【发布时间】:2016-02-16 11:22:56
【问题描述】:
我有一个带有Hi here's my [KEYWORD phone number], let me know when you wanna hangout: [PHONE 7802708523]. I live in a [PROP_TYPE condo] in [CITY New York] 格式标记数据的文档。我想根据一组这些类型的标记文档训练一个模型,然后使用我的模型来标记新文档。这在 NLTK 中可能吗?我查看了chunking 和NLTK-Trainer 脚本,但它们的标签和语料库是有限的,而我的数据集有自定义标签。
【问题讨论】:
-
BIO 块标签似乎是正确的方向,请参阅 lingpipe-blog.com/2009/10/14/… 。取决于您如何对输入进行编码,您可能需要一个细粒度分类器在分块后标记识别
PHONE或KEYWORD。 -
您能再提供几个例子吗?都是电话号码吗?也许添加[标签:信息提取]?
-
没有,数据五花八门,包括电话号码、地址、姓名、日期等。对于BIO块标签,有没有一些代码示例我可以看看?
标签: nlp nltk information-extraction supervised-learning