【发布时间】:2011-09-19 15:49:36
【问题描述】:
我有一个包含大约 30,000 个文档的 tf-idf 向量的数据库。
我想为给定文档返回一组相似的文档 - 大约 4 个左右。
我考虑过对数据(具有余弦相似度)实施 K-Means(聚类算法),但由于存在许多不确定性,我不知道这是否是最佳选择:我不知道该放什么初始集群,我不知道要创建多少个集群,我担心集群会太不平衡,我不确定结果质量会不会好,等等。
非常感谢有经验的用户提供的任何建议和帮助。
谢谢,
凯蒂
【问题讨论】:
-
你的向量有多稀疏。即每个文档/每个查询的平均术语数?
-
非常稀疏。大约有 30,000 个不同的 2-4 页文档。
-
查询有多稀疏?例如。 5 个术语 => 30k cos distnces 需要时间 ~ 5 * 30k,够快吗?
-
时间还包括从数据库中检索 30k 文档向量,然后计算给定文档与所有其他 30k 文档之间的 cos 距离。向量中的平均项数为 10。
标签: cluster-analysis document k-means tf-idf