【发布时间】:2014-12-07 00:09:03
【问题描述】:
我有 200 万条推文,我需要将其分为三类:
- 喜欢该产品;
- 不喜欢;和
- 产品建议。
但是你如何检查你的分类结果呢?我是不是应该随机选择一些推文,手动阅读它们的内容并检查它们的内容是否与给它们的分类标签匹配?还是有更好的方法?
我听说有一些企业级软件包可以进行多级分类,但是有人如何证明他们的结果是有意义的,而不需要手动检查数百万条记录并检查分类?
【问题讨论】:
-
我什至不确定你想要什么。如果要对推文进行分类,则需要有垃圾箱。例如“关于名人的推文”和“不关于名人的推文”。如果你连这个都没有,那么最好的办法是使用无监督学习方法,例如 k 均值。因此,提取有关您的推文的信息(长度、转发次数、字数等),然后使用聚类算法。如果你的交叉验证结果很好,说明你找到了相关的分类。 (而且你不需要手动检查)
-
@Fezvez 首先感谢您的写作。问题是这样的:- 200 万条推文分为 3 类“喜欢产品”、“不喜欢”、“产品建议”。现在因为所有推文都没有标签,所以你建议我使用 K-means。你能告诉我我应该在我的 3 类案例中具体寻找什么样的信息/功能,我只是在前一行?这将是巨大的帮助!!!!!!
-
“只需要一些指示/建议” 不是关于 SO 的主题问题。
-
@jonrsharpe 谢谢。您能否建议根据标签在推文中选择哪些特征来进行 3 类分类。
-
@shalini 您应该寻找哪些功能与您当前所问的问题完全不同,在这里也是题外话。请阅读content in the Help Center。
标签: python twitter machine-learning multilabel-classification