【发布时间】:2020-10-15 21:24:11
【问题描述】:
我应该仅从训练数据还是所有数据构建词汇表,这不会对测试数据产生两种方式的影响吗?我的意思是:
-
如果我们只从训练数据中构建词汇表,如果词汇表中没有单词,模型将无法识别验证和测试数据中的很多单词。
-
在这种情况下考虑预训练的词嵌入是否有帮助(即模型不是从训练数据而是从预训练的词嵌入中学习新词)?
-
如果是,随机初始化的词嵌入会产生同样的效果吗?
-
相反,我看到很多例子,编码人员根据整个数据构建词汇,测试和验证数据与训练数据共享。这不是很明显的数据泄露问题吗?
【问题讨论】:
标签: nlp pytorch recurrent-neural-network word-embedding vocabulary