【问题标题】:Spacy - number of lemmaSpacy - 引理数
【发布时间】:2020-04-16 07:11:24
【问题描述】:

在我使用向量作为循环神经网络的输入之后,我正在使用 spacy 将句子中的每个单词替换为数字/代码。

import spacy
 str="basing based base"
 sp = spacy.load('en_core_web_sm')
 sentence=sp(str)
 for w in sentence:
    print(w.text,w.lemma)

在使用 keras 的神经网络的第一层,即嵌入层,我必须知道查找表中的最大单词数,有人知道这个数字吗? 谢谢

【问题讨论】:

  • 如何获得整数索引,用于从层获取嵌入?是 spacy 的内部 ID 吗?

标签: python keras neural-network spacy lemmatization


【解决方案1】:

引理索引实际上是散列,因此从 0 到词汇条目数之间没有连续的索引行。甚至sp.vocab.strings["randomnonwordstring#"] 也会给你一个整数。

对于条目“base”,ID 是sp.vocab 中的4715552063986449646(请注意,它是表单和引理的共享词汇)。你永远不会在内存中容纳这么多的嵌入。

正确的解决方案是创建一个字典,根据您在训练数据中的内容将单词转换为索引。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-05-11
    • 1970-01-01
    • 2020-11-10
    • 1970-01-01
    相关资源
    最近更新 更多