【发布时间】:2021-06-28 00:55:19
【问题描述】:
我正在使用 SpaCy 将文本分成句子,在每个句子上匹配正则表达式模式,并根据匹配结果使用一些逻辑。我从一种天真的方法开始,例如:
nlp = spacy.load("en_core_web_trf")
regex = re.compile(r'\b(foo|bar)\b')
for text in texts_list:
doc = nlp(text)
for sent in doc.sents:
if re.search(regex, str(s)):
[...]
else:
[...]
而且速度很慢。然后我用了一个管道:
for doc in nlp.pipe(texts_list, disable=['tagger', 'ner', 'attribute_ruler', 'lemmatizer'], n_process=4):
for sent in doc.sents:
if re.search(regex, str(s)):
[...]
else:
[...]
但它仍然很慢。我错过了什么吗?
【问题讨论】:
标签: python nlp spacy transformer sentence