【发布时间】:2019-01-13 16:06:09
【问题描述】:
我正在使用自定义模型进行实体提取。我在一个大型数据集上训练了基于 CRF 的模型
java -Xmx16g stanford-ner.jar edu.stanford.nlp.ie.crf.CRFClassifier -prop ner.prop
使用这些功能
属性文件 (ner.prop)
trainFile = training_data_IOB.tsv
#serializeTo = ner-model.ser.gz
map = word=0,answer=1
useClassFeature=true
useWord=true
qnSize=10
entitySubclassification=IOB1
retainEntitySubclassification=true
mergeTags=true
useNGrams=true
noMidNGrams=true
maxNGramLeng=6
usePrev=true
useNext=true
useSequences=true
usePrevSequences=true
maxLeft=1
useTypeSeqs=true
useTypeSeqs2=true
useTypeySequences=true
wordShape=chris2useLC
useDisjunctive=true
useGazettes=true
gazette=gazetter.txt
sloppyGazette=true
训练文件(training_data_IOB.tsv)
Thousands O
of O
demonstrators O
have O
marched O
through O
London B-LOC
to O
protest O
the O
war O
in O
Iraq B-LOC
... ...
公报文件(gazetter.txt)
B-LOC Iraq
B-LOC Afghanistan
B-ORG Congressional
B-LOC Bangladesh
B-LOC Canada
B-ORG ...
新模型创建为 ner-model.ser.gz 并且运行良好。
现在我的问题是,如何在没有任何手动计数和计算的情况下计算任何未见(新)数据的百分比准确度??
我是这个领域的新手,所以请发布详细的描述性答案。谢谢你的时间。
【问题讨论】:
标签: stanford-nlp named-entity-recognition