【问题标题】:Vectorizing text file in java for kmeans clustering java encog在java中为kmeans聚类java encog向量化文本文件
【发布时间】:2015-07-26 21:32:03
【问题描述】:

我正在使用 java encog 机器学习库来运行 kmeans 集群。问题是它只能用于数字数据。有没有办法对文本文件(数据)进行矢量化,以便我可以直接输入 kmeans 聚类算法。

我是这个领域的新手。任何帮助表示赞赏。

【问题讨论】:

  • 可能更适合 datascience.stackexchange.com 。但是,您必须解释您的实体是什么,以及您想要使用什么距离度量。如果您有多个文本,并且想找出文本之间的相似性,一种常见的做法(据我所知)是收集所有文本中的所有单词(假设为 100 个单词),然后创建一个 100 维向量对于每个文本。该向量对文本中的单词有一个“1”,对所有其他条目有一个“0”。

标签: java vectorization k-means encog


【解决方案1】:

尝试使用对象输出流 如下

ByteArrayOutputStream baos = new ByteArrayOutputStream();
ObjectOutputStream oos = new ObjectOutputStream(baos);
oos.writeObject("YOUR_TEXT");
oos.close();

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-08-16
    • 2014-07-23
    • 2011-05-30
    • 2017-04-10
    • 2021-05-27
    • 2015-02-14
    • 2015-01-10
    • 2015-03-09
    相关资源
    最近更新 更多