【发布时间】:2013-01-21 11:41:37
【问题描述】:
我打算在 Twitter 上编写一个主题检测工具。我一直在考虑两个 tweets 之间的良好相似性度量(距离),以及如何表示它们,并计算:
-
#hashtags(我认为标签在 Twitter 上检测主题时非常重要) - 回复(如果有人回复 tweet,那些推文可能谈论的是同一个话题,尽管两个人可能会开始谈论 samsung galaxy 并结束谈论iphone越狱等)
我正在考虑实施我目前所拥有的并做一些实验。我将实现经典模型(如TF*IDF 并使用欧几里得距离、角余弦等)和带有一些相似性度量的布尔模型(Hamming、Jaccard 等)。
关于如何将一些现有模型适应 Twitter 的任何想法或关于如何创建新模型的一些想法?
【问题讨论】:
标签: twitter machine-learning cluster-analysis information-retrieval topic-modeling