【发布时间】:2015-11-19 20:07:27
【问题描述】:
是否可以在 NLTK 中获得短语的一致性?
import nltk
from nltk.corpus import PlaintextCorpusReader
corpus_loc = "c://temp//text//"
files = ".*\.txt"
read_corpus = PlaintextCorpusReader(corpus_loc, files)
corpus = nltk.Text(read_corpus.words())
test = nltk.TextCollection(corpus_loc)
corpus.concordance("claim")
例如上面的返回
on okay okay okay i can give you the claim number and my information and
decide on the shop okay okay so the claim number is xxxx - xx - xxxx got
现在如果我尝试corpus.concordance("claim number") 它不起作用...我确实有代码可以通过使用.partition() 方法和一些进一步的编码来做到这一点...但我想知道是否使用concordance 也可以做到这一点。
【问题讨论】:
-
NLTK.text.concordance 似乎只需要一个词。但是,一种选择是将两个文本中的“claim number”替换为“claim_number”,并获得“claim_number”的一致性。