【发布时间】:2015-01-13 11:12:36
【问题描述】:
我在 R 中以以下形式获取 POS 标记文本:
id 类型 开始 结束 功能
1 单词 1 5 POS=NNP
2 字 7 8 POS=IN
.....
例如,我想检索它已标记的单词,而不是具有所有值的列“type”,因为单词检索实际单词。我可以使用scan_tokenizer,但是当有像“不是”这样的形式时,问题就出现了,POS标记器将它分成“是”和“不是”,这很好,但是scan_tokenizer不会以这种方式标记它只是保持它在“不是”。谁能帮我检索 R 已标记并用于 POS 标记的单词?
谢谢
【问题讨论】: