【发布时间】:2017-08-28 09:02:53
【问题描述】:
给定一个特定长度的文档字符串 s 和一个相同长度的语言掩码 l,我想使用相应的 spacy 语言模型处理文档的每个部分 (span?)。
举个例子
s = 'As one would say in German: Wie man auf englisch zu sagen pflegt'
l = ['en'] * 27 + ['de'] * 37
我想构建一个文档
import spacy
nlp_de = spacy.load('de')
nlp_en = spacy.load('en')
d_de = nlp_de(u"".join([c for i,c in enumerate(s) if l[i] == "de"]))
d_en = nlp_en(u"".join([c for i,c in enumerate(s) if l[i] == "en"]))
现在我必须以某种方式将这两个部分粘合在一起。但不幸的是,spacy 中的文档包含有关词汇的信息。因此,这将是模棱两可的。
我应该如何使用 spacy 为我的多语言文档建模?
【问题讨论】:
-
我相信 spacy 有一个多语言模型,可以在一个模型中处理英语和德语。检查模型列表。
-
但目前基于 spacy 文档的多语言:“维基百科语料库。分配命名实体。支持识别荷兰语、英语、法语、德语、法语、意大利语、波兰语的 PER、LOC、ORG 和 MISC 实体、葡萄牙语、俄语和西班牙语。”
标签: python data-structures nlp multilingual spacy