【问题标题】:Tweets classification推文分类
【发布时间】:2014-07-11 23:33:06
【问题描述】:

我正在尝试进入机器学习领域,因此我想尝试在推文上进行文本分类。我收集了一小部分推文样本,但为了执行任何监督学习,我需要手动标记我收集的一些推文。当我扩大数据规模时,这是一项艰巨的任务。

有没有什么方法可以在不手动标记大量推文的情况下进行分类? 或者无监督学习更适合这项任务?

【问题讨论】:

    标签: twitter machine-learning text-classification


    【解决方案1】:

    推文是短文本。您应该尝试为短文本分类量身定制的分类器,例如 LibShortText:https://www.csie.ntu.edu.tw/~cjlin/libshorttext/

    本文解释了短文本(标题)与全文分类的某些属性:https://www.csie.ntu.edu.tw/~cjlin/papers/title.pdf

    分类将始终涉及标记数据(主动学习技术有助于标记数据集),但您可以利用 Snorkel(数据编程)等新兴技术来缓解一些问题:https://github.com/HazyResearch/snorkel

    【讨论】:

      【解决方案2】:

      为此类问题创建了半监督学习方法。最简单的方法包括手动标记少量观察,在标记数据上运行监督学习算法以选择分类器来标记其他观察,然后重复此过程。

      【讨论】:

      • 我应该手动标记多少百分比的数据才能获得不错的多类分类准确性?由于推文如此多样化,我想至少应该有 10 个类。
      • 抱歉,我不确定。但我记得读过一个示例,其中仅标记了 2 个观察值并使用了半监督学习。所以也许如果你从 10 开始,然后只使用少数最重要的分类,然后重复,就可以了。
      猜你喜欢
      • 2019-04-17
      • 2015-01-11
      • 2014-06-24
      • 2016-08-20
      • 2020-11-01
      • 2012-02-05
      • 2023-04-03
      • 2014-04-08
      • 2020-07-19
      相关资源
      最近更新 更多