【问题标题】:Representation and a good similarity measure between Tweets for topic detection用于主题检测的推文之间的表示和良好的相似性度量
【发布时间】:2013-01-21 11:41:37
【问题描述】:

我打算在 Twitter 上编写一个主题检测工具。我一直在考虑两个 tweets 之间的良好相似性度量(距离),以及如何表示它们,并计算:

  • #hashtags(我认为标签在 Twitter 上检测主题时非常重要)
  • 回复(如果有人回复 tweet,那些推文可能谈论的是同一个话题,尽管两个人可能会开始谈论 samsung galaxy 并结束谈论iphone越狱等)

我正在考虑实施我目前所拥有的并做一些实验。我将实现经典模型(如TF*IDF 并使用欧几里得距离角余弦等)和带有一些相似性度量的布尔模型(Hamming、Jaccard 等)。

关于如何将一些现有模型适应 Twitter 的任何想法或关于如何创建新模型的一些想法?

【问题讨论】:

    标签: twitter machine-learning cluster-analysis information-retrieval topic-modeling


    【解决方案1】:

    Similarity Metrics on Twitter 讨论了一些关于可用于将来自 twitter 的数据聚集在一起的不同相似性度量的细节。我们根据用户连接、用户提及、地理位置、推文之间的内容相似性、用户描述之间的内容相似性和常见的#hashtags 对 Twitter 上的用户进行了聚类研究。

    对于在 twitter 上寻找共同话题,寻找讨论话题的用户之间的联系确实很有帮助,我们发现一组用户倾向于讨论共同话题。在this post的后半部分有这方面的一些细节。

    【讨论】:

    • 感谢您的回复。我现在看看那些文章:)
    • 嗨,Pulkit,你有没有我可以阅读的描述你所做的工作的论文?
    猜你喜欢
    • 2018-01-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-03-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多