【问题标题】:Baum-Welch algorithm for pos tagger用于 pos tagger 的 Baum-Welch 算法
【发布时间】:2011-07-10 04:26:15
【问题描述】:

每个人。 我正在使用 Baum-Welch 算法来训练一个 pos 标注器,它完全是无监督的。 问题来了: 当我得到标签结果时,我只得到一个数字序列。 我不知道哪个标签代表 VV、NN、DT。 我该如何解决这个问题?

【问题讨论】:

  • 你标记的是什么语言?
  • 你应该得到每个单词的概率,然后你选择概率最高的那个..
  • 但我不知道哪个标签代表哪个 pos 标签。我只得到 1 2 3 5 2 3

标签: nlp machine-learning hidden-markov-models pos-tagger


【解决方案1】:

一般来说,没有办法做到这一点。 Baum-Welch 会找到具有相似分布的单词使用类别,但没有特别的理由假设这些类别将以任何直接的方式映射到任何特定语言学理论所假定的类别。因此,无监督的词性标注器主要适用于您关心单词或短语的等价类而不关心分配的特定标签的应用程序。

不过,如果您真的需要人类可读的标签(例如,在开发过程中,评估您获得的结果是否可信),我会手动标记几十个句子。然后,您可以将您的 B-W 派生标注器应用于已标记的迷你语料库,以诱导类别编号和 POS 标签之间的映射。

【讨论】:

  • 在我看来,无监督的方式似乎不是创建有用的 pos 标记器的好选择。谢谢你的解释!!
猜你喜欢
  • 2012-01-12
  • 2011-12-19
  • 2014-06-11
  • 2018-06-26
  • 2012-11-01
  • 1970-01-01
  • 2016-05-12
  • 2016-02-14
  • 1970-01-01
相关资源
最近更新 更多