【发布时间】:2015-10-06 23:03:31
【问题描述】:
我在我的项目中使用 NLTK,并且已经实现了 Viterbi 算法来进行标记(尽管我知道标记器非常可用)。 我在我的代码中使用了以下代码
tagdict = load('help/tagsets/brown_tagset.pickle')
taglist = tagdict.keys()
tag_sequence_corpus = brown.tagged_sents(tagset='brown')
前两行用于从棕色标记集中提取键,其中键是棕色标记集中可用的标记列表。 第三行的参数 tag-set='brown' 用于根据 Brown 语料库提供的标签集标记 brown 语料库。
有什么方法可以将标签集参数设置为宾夕法尼亚银行标签集?这样做的动机是 Penn Bank 树有大约 36-45 个标签,这使得实现 Viterbi 算法(算法的复杂性为 O(n*|S|^3) )成为可能,其中 n 是句子的长度|S|指标签集的大小,而棕色语料库中有大约 226 个标签(这增加了计算时间)。并且通用标签集容易产生词义歧义。
如果 PTB 标记器不可用,是否有人建议替代它(布朗/通用除外)?
谢谢。
【问题讨论】:
标签: nlp nltk pos-tagger