【发布时间】:2015-07-26 21:32:03
【问题描述】:
我正在使用 java encog 机器学习库来运行 kmeans 集群。问题是它只能用于数字数据。有没有办法对文本文件(数据)进行矢量化,以便我可以直接输入 kmeans 聚类算法。
我是这个领域的新手。任何帮助表示赞赏。
【问题讨论】:
-
可能更适合 datascience.stackexchange.com 。但是,您必须解释您的实体是什么,以及您想要使用什么距离度量。如果您有多个文本,并且想找出文本之间的相似性,一种常见的做法(据我所知)是收集所有文本中的所有单词(假设为 100 个单词),然后创建一个 100 维向量对于每个文本。该向量对文本中的单词有一个“1”,对所有其他条目有一个“0”。
标签: java vectorization k-means encog