【发布时间】:2012-10-03 17:32:57
【问题描述】:
我希望使用他们的主题表示来计算用户和文本文档之间的相似性。 IE。每个文档和用户都由一个主题向量(例如神经科学、技术等)以及该主题与用户/文档的相关程度来表示。
我的目标是计算这些向量之间的相似度,以便找到相似的用户、文章和推荐文章。
我曾尝试使用 Pearson Correlation,但一旦达到约 40k 篇文章并且向量的长度约为 10k,它最终会占用过多的内存和时间。
我正在使用 numpy。
你能想出更好的方法来做到这一点吗?还是不可避免(在单台机器上)?
谢谢
【问题讨论】:
标签: python numpy recommendation-engine topic-modeling gensim