【问题标题】:Mallet POS-Tagging learning timeMallet POS-Tagling 学习时间
【发布时间】:2016-10-06 09:17:27
【问题描述】:

我一直在尝试使用 Mallet Simple Tagger (http://mallet.cs.umass.edu/sequences.php) 来学习用于 POS 标记的 CRF 模型。

我现在开始感到担心/困惑,因为我的计算机已经为这个模型学习了一个多星期。 它似乎没有挂断,因为它仍然以以下形式给我输出:

...  
Punkte  NN->Puppenk�nig NN(Puppenk�nig  NN) Punkte  NN,Puppenk�nig  NN  
Punkte  NN->Obere   NN(Obere    NN) Punkte  NN,Obere    NN  
Punkte  NN->Entfernung  NN(Entfernung   NN) Punkte  NN,Entfernung   NN  
...

所以我想问一下,Mallet花这么长时间是正常的,还是出了什么问题?

我使用了网页上指定的命令:

hough@gobur:~/tagger-test$ java -cp  
 "/home/hough/mallet/class:/home/hough/mallet/lib/mallet-deps.jar"
 cc.mallet.fst.SimpleTagger
 --train true --model-file nouncrf  sample

训练数据包含 96903 个 Token。

编辑:
我们假设,它可能与输入的形式有关。网站指定形式:

Bill CAPITALIZED noun  
slept non-noun   
here LOWERCASE STOPWORD non-noun

SimpleTagger(http://mallet.cs.umass.edu/api/) 的文档指出每个实例应该是一个单独的块,用空行分隔。虽然我不确定实例是什么意思,但我想,预期的形式是这样的:

word pos  
word pos  
. $.  

word pos  
word pos  
word pos  
. $.  

word pos  
word pos    
. $.  

...

这是正确的格式吗?也许有人有一个示例文件来显示格式应该是什么样的?

【问题讨论】:

    标签: mallet


    【解决方案1】:

    100k 令牌语料库的一周似乎太长了。我预计最多大约半小时。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2011-08-01
      • 2017-07-16
      • 2012-05-28
      • 2018-08-26
      • 1970-01-01
      • 2016-03-14
      • 1970-01-01
      相关资源
      最近更新 更多