【发布时间】:2018-07-01 21:50:15
【问题描述】:
我正在尝试使用 CoNLL-2003 NER(英语)数据集,并且我正在尝试为其使用预训练嵌入。我正在使用 SENNA 预训练嵌入。现在,我的词汇表中有大约 20k 个单词,而其中只有 9.5k 个单词的嵌入可用。
我目前的方法是用零初始化一个 20k X embedding_size 数组,并初始化我知道其嵌入的 9.5k 个单词,并使所有嵌入都可以学习。
我的问题是最好的方法是什么?对此类研究的任何参考都会非常有帮助吗?
【问题讨论】:
标签: machine-learning nlp deep-learning word-embedding