【发布时间】:2021-11-07 17:37:13
【问题描述】:
我正在尝试对西班牙语文本进行 NLP 分析。因此,为了进行词形还原,我使用 Spacy,因为 NLTK 没有用于词法的西班牙语版本。 Spacy 的问题是我可以通过 Lemmatizer 的单词数量受到限制:
ValueError: [E088] 长度为 6095095 的文本超过最大值 1000000。解析器和 NER 模型在输入中每 100,000 个字符需要大约 1GB 的临时内存。这意味着长文本可能 导致内存分配错误。如果您不使用解析器或 NER, 增加
nlp.max_length限制可能是安全的。极限 是字符数,因此您可以检查您的输入是否 检查len(text)太长了。
我尝试使用 nlp.max_length= 6095095,但在使用所有可用 RAM 后会话崩溃。
有什么建议吗?
【问题讨论】:
-
你的问题标题和你的问题内容没有关系?
-
(注意:我编辑了标题以匹配问题。我仍然不确定为什么会这样。)
标签: nlp spacy lemmatization