【发布时间】:2018-02-27 14:16:27
【问题描述】:
我正在做一个 NLP 项目,涉及到 sentence2vec。我假设我将使用预先训练的词嵌入将标记转换为向量,然后继续进行句子嵌入。
由于我的句子涉及:
can't, won't, aret 等停用词 NLTK 会简化为 {ca, wo, are} + not。
所以我不能减少它们,我不想将它们作为停用词删除,因为下面提到的句子应该有不同的嵌入。
我叫普里扬克
我的名字不是普里扬克
另一个重要的疑问是如何在我的句子向量中合并命名实体,例如像 Mark K. Hogg 这样的人的名字。
【问题讨论】:
标签: python nlp word2vec sentence-similarity