【问题标题】:Classification of tweets into 4 categories推文分为 4 类
【发布时间】:2015-01-11 20:52:40
【问题描述】:

我提到了这个类似的查询twitter/facebook comments classification into various categories 但我的问题有点不同。我有一些 10k 条推文,我想将它们分为 4 个类别,即“旅行”、“购物”、“吃”、“玩”。 现在的问题是,由于推文的长度非常小,应该使用什么工具将这些推文分为这 4 类?在删除停用词并清理 cmets 后,它们的大小变得更小,可以保存足够相关的任何信息,将它们分为 4 类。在这种情况下哪种算法最有效:“小文本”大小。

我在某处读到我应该简单地使用 Lucene 而不是 NLTK。但作为 Lucene 的新手,我真的不明白 Lucene 将如何在这种多分类中提供任何帮助。

【问题讨论】:

  • 只要你知道你在做什么(你使用的算法等等),你使用python/java/R哪个平台并不重要
  • @badc0re 谢谢,但您建议使用什么方法对推文进行分类。我将如何生成特征以便将它们分类到给定的类别中。如果你能记下一些逐步的要点,我将非常感激。非常感谢朋友!!!!

标签: python twitter lucene classification nltk


【解决方案1】:

你可以试试 naive bayes, random forest 或者你可以试试EM 这样的无监督算法(然后根据分组定义标签簇)。 注意所有类中使用的常用词。您可以尝试使用 AUC 等来评估您的表现。还可以尝试找到选择特征的方法,称为 互信息

祝你好运!

【讨论】:

  • 嗨,我尝试为每个标签手动标记 100 个文档。现在我为 4 个类别中的每一个类别提供了 100 个示例。我现在应该使用哪个分类器。
  • 拥有训练数据并不是那么简单,您还应该分析每个类别使用了哪些特征并去除不必要的噪音。如果您只想查看整个过程是如何工作的,您可以使用朴素贝叶斯并查看类的先验概率或特征的联合概率。
  • 谢谢哥们,你能否建议如何做这个朴素的贝叶斯然后我准备好赶上。或者一个与你刚刚写的内容一致的教程,因为太多了,我不知道我的案例要遵循哪一个。相信我,自从我发布它的那天起,我就一直在解决这个问题,因此我一直保留只有当我遇到某些事情时才会回来。非常感谢。
  • 使用答案的链接,还有这些data-miningInfo-ret
  • 在这种情况下 vowpal-wabbit 会提供帮助吗?
猜你喜欢
  • 2014-07-11
  • 2016-08-20
  • 2019-04-17
  • 2014-06-24
  • 2014-01-25
  • 2020-11-01
  • 2012-02-05
  • 2023-04-03
  • 2014-04-08
相关资源
最近更新 更多