【发布时间】:2021-05-05 08:33:40
【问题描述】:
我有大量的句子语料库 (~ 1.1M) 可以通过斯坦福核心 NLP 进行解析,但在输出中我得到的句子比输入中的要多,可能系统将超出给定分段的一些句子分割成行。
为了控制发生的事情,我想在输入中包含“标签”。这些标签在输出中应该是可识别的,并且不应该影响解析。
类似
<0001>
I saw a man with a telescope .
</0001>
或
#0001#
I saw a man with a telescope .
#/0001#
我尝试了许多格式,在所有情况下,“标签”都被解析为文本的一部分。
有没有办法告诉解析器“不要解析这个,只在输出中保持它原样”?
===几个小时后===
因为我没有得到答案,所以举个例子:我想处理句子“Manon espérait secrètement y revoir un garçon qui l'avait marquée autrefois”。带有标签151_0_4。我想在两行等号之间单独写一个标签,然后是一个句点,以确保标签在最坏的情况下会被作为一个单独的句子处理:
=====151_0_4======.
Manon espérait secrètement y revoir un garçon qui l'avait marquée autrefois.
=====151_0_4======.
这就是产生的结果:
(ROOT (SENT (NP (SYM =)) (NP (SYM =) (PP (SYM =) (NP (SYM =) (PP (SYM =) (NP (NUM 151_0_4) (SYM =) (SYM =) (NP (SYM =) (PP (SYM =) (NP (SYM =) (SYM =))))))))) (PUNCT .)))
正如你所见,标签肯定被认为是句子的一部分,没有办法将它们与它分开。
类似 XML 的标签 <x151_0_4> 或使用哈希字符的标签也会发生同样的情况...
【问题讨论】:
标签: stanford-nlp