【发布时间】:2018-03-26 13:56:01
【问题描述】:
SpaCy 的文档有一些关于添加新俚语here 的信息。
不过,我想知道:
(1) 什么时候应该调用下面的函数?
lex_attr_getters[NORM] = add_lookups(Language.Defaults.lex_attr_getters[NORM], NORM_EXCEPTIONS, BASE_NORMS)
根据介绍指南here,spaCy的典型用法如下:
import spacy
nlp = spacy.load('en')
# Should I call the function add_lookups(...) here?
doc = nlp(u'Apple is looking at buying U.K. startup for $1 billion')
(2) 在处理管道中何时处理规范异常?
我假设一个典型的管道是这样的:tokenizer -> tagger -> parser -> ner。
是否在分词器之前处理了规范异常?此外,规范异常组件相对于其他预处理组件(例如停用词、词形还原器)是如何组织的(请参阅组件的完整列表 here)?什么在什么之前?
我是 spaCy 的新手,我们将不胜感激。谢谢!
【问题讨论】: