【发布时间】:2018-09-25 23:20:16
【问题描述】:
我有一个带注释的数据集,首先我使用来自 nltk 的 sent_tokenizer 来检测句子。现在我必须定义一个特征,比如检查 i 和 j(名词短语)是否都在第一句话中并做一些工作,然后它应该转到下一个句子并再次定义 i 和 j 并做同样的工作。在python中怎么做?
这是我从数据集中检测到的第一句话:
در
همین
حال
،
<coref coref_coref_class="set_0" coref_mentiontype="ne" markable_scheme="coref" coref_coreftype="ident">
نجیب
الله
خواجه
عمری
،
</coref>
<coref coref_coref_class="set_0" coref_mentiontype="np" markable_scheme="coref" coref_coreftype="ident">
سرپرست
وزارت
تحصیلات
عالی
افغانستان
</coref>
گفت
که
در
سه
ماه
گذشته
در
۳۳
ولایت
کشور
.
现在 - 如果检测到第一句话,如何编写代码。它检查 i 和 j 是否在一个句子中返回 True。然后转到下一句。
for sentence in sent_tokenize(text):
print(sentence) # it will print all the sentences
if i_NP ... and j_NP:
return True
【问题讨论】: