【发布时间】:2016-10-06 09:17:27
【问题描述】:
我一直在尝试使用 Mallet Simple Tagger (http://mallet.cs.umass.edu/sequences.php) 来学习用于 POS 标记的 CRF 模型。
我现在开始感到担心/困惑,因为我的计算机已经为这个模型学习了一个多星期。 它似乎没有挂断,因为它仍然以以下形式给我输出:
...
Punkte NN->Puppenk�nig NN(Puppenk�nig NN) Punkte NN,Puppenk�nig NN
Punkte NN->Obere NN(Obere NN) Punkte NN,Obere NN
Punkte NN->Entfernung NN(Entfernung NN) Punkte NN,Entfernung NN
...
所以我想问一下,Mallet花这么长时间是正常的,还是出了什么问题?
我使用了网页上指定的命令:
hough@gobur:~/tagger-test$ java -cp
"/home/hough/mallet/class:/home/hough/mallet/lib/mallet-deps.jar"
cc.mallet.fst.SimpleTagger
--train true --model-file nouncrf sample
训练数据包含 96903 个 Token。
编辑:
我们假设,它可能与输入的形式有关。网站指定形式:
Bill CAPITALIZED noun
slept non-noun
here LOWERCASE STOPWORD non-noun
SimpleTagger(http://mallet.cs.umass.edu/api/) 的文档指出每个实例应该是一个单独的块,用空行分隔。虽然我不确定实例是什么意思,但我想,预期的形式是这样的:
word pos
word pos
. $.
word pos
word pos
word pos
. $.
word pos
word pos
. $.
...
这是正确的格式吗?也许有人有一个示例文件来显示格式应该是什么样的?
【问题讨论】:
标签: mallet