【问题标题】:How does twitter's trending topics algorithm decide which words to extract from tweets?twitter 的热门话题算法如何决定从推文中提取哪些词?
【发布时间】:2011-01-01 01:07:29
【问题描述】:

我看到this question,它专注于“布兰妮斯皮尔斯”问题。但我有一点不同的问题。算法如何确定需要对哪些单词或短语进行排名?比如我发了一条推文说“迈克尔杰克逊死了”,它怎么知道拉出“迈克尔杰克逊”而不是“死了”?

或者假设 Alec Baldwin 和 Steven Baldwin 那天出现在新闻中,因此在很多推文中都提到了。它怎么知道要区别对待这两个名字,而不是仅仅拔出“鲍德温”?

天真地完成了,我可以将此问题视为 NP 完全问题(您必须将推文中的所有潜在短语与其他所有人推文中的所有潜在短语进行比较)。

【问题讨论】:

    标签: algorithm twitter nlp ranking


    【解决方案1】:

    此问题的一般解决方案是使用"term frequency, inverse document frequency" (tf-idf)

    这是一种统计方法,可以找到比其他词/术语更相关的词/术语,因为它们不常出现。在这种情况下,与常见的英文单词“die”相比,“Michael Jackson”这个名字的使用频率可能非常低。

    至于 Alec Baldwin 与 Steven Baldwin - 这些将在 part-of-speech tagging 期间被识别为单独的 - 它们将被标记为单独的专有名词。

    【讨论】:

      【解决方案2】:

      我相信它会寻找常见的词组。此外,他们似乎引用了http://www.whatthetrend.com/

      除此之外,还可能涉及到轻微的人为控制。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2017-10-07
        • 2021-09-05
        • 2015-09-10
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-05-21
        • 2011-08-01
        相关资源
        最近更新 更多