【问题标题】:How does one check classification results on two million tweets?如何检查 200 万条推文的分类结果?
【发布时间】:2014-12-07 00:09:03
【问题描述】:

我有 200 万条推文,我需要将其分为三类:

  • 喜欢该产品;
  • 不喜欢;和
  • 产品建议。

但是你如何检查你的分类结果呢?我是不是应该随机选择一些推文,手动阅读它们的内容并检查它们的内容是否与给它们的分类标签匹配?还是有更好的方法?

我听说有一些企业级软件包可以进行多级分类,但是有人如何证明他们的结果是有意义的,而不需要手动检查数百万条记录并检查分类?

【问题讨论】:

  • 我什至不确定你想要什么。如果要对推文进行分类,则需要有垃圾箱。例如“关于名人的推文”和“不关于名人的推文”。如果你连这个都没有,那么最好的办法是使用无监督学习方法,例如 k 均值。因此,提取有关您的推文的信息(长度、转发次数、字数等),然后使用聚类算法。如果你的交叉验证结果很好,说明你找到了相关的分类。 (而且你不需要手动检查)
  • @Fezvez 首先感谢您的写作。问题是这样的:- 200 万条推文分为 3 类“喜欢产品”、“不喜欢”、“产品建议”。现在因为所有推文都没有标签,所以你建议我使用 K-means。你能告诉我我应该在我的 3 类案例中具体寻找什么样的信息/功能,我只是在前一行?这将是巨大的帮助!!!!!!
  • “只需要一些指示/建议” 不是关于 SO 的主题问题。
  • @jonrsharpe 谢谢。您能否建议根据标签在推文中选择哪些特征来进行 3 类分类。
  • @shalini 您应该寻找哪些功能与您当前所问的问题完全不同,在这里也是题外话。请阅读content in the Help Center

标签: python twitter machine-learning multilabel-classification


【解决方案1】:

老实说,这是您要解决的一个大问题。

一个非常基本的方法开始(它的结果很差,但总比没有好),手动分类 1000 条推文。它将帮助您了解要分类的内容。

然后,为您的 200 万条推文中的 1000 个最受欢迎的词创建一个数据库。手动编辑此数据库(删除对您的问题无用的单词,例如单词“the”或“is”)。尝试建立一个“好”词数据库(比如,爱,惊人),一个“坏”词数据库(坏,烂,......)和一个“建议”数据库(建议,错误,我没有还要别的吗)。目标是将您的数据库减少到对您的问题最有用的单词(例如,最后只使用 100 个单词)

每条推文都变成大小为 100 的向量。用它做任何你想做的技术(朴素贝叶斯、SVM 等)

这整个过程是我前一阵子为垃圾邮件分类所做的课程的大纲。它工作得非常好(98% 的识别率?)。然后,我们真正的项目是对论坛上的仇恨邮件进行分类(诸如“去死”之类的消息)。我认为我们得到了 80% 的识别率,这很差。但总比没有好。

由于您的 200 万条推文未分类,因此您很难使用此方法检查结果。您将只能对 1000 个样本进行交叉验证。只是一个警告

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2019-10-27
    • 2020-10-29
    • 2017-08-20
    • 2014-08-10
    • 1970-01-01
    • 1970-01-01
    • 2021-07-09
    • 1970-01-01
    相关资源
    最近更新 更多