【发布时间】:2018-11-16 07:27:33
【问题描述】:
假设我正在训练 min_count=5 的 (Gensim) Word2Vec 模型。文档告诉我们 min_count 做了什么:
忽略总频率低于此的所有单词。
min_count 对上下文有什么影响?假设我有一个由常用词(min_count > 5)和不常用词(min_count
this (f) is (f) a (f) test (i) sentence (i) which (f) is (f) shows (i) here (i)
我只是编造了哪个词经常使用,哪个词不用于演示目的。
如果我删除所有不常用的单词,我们会得到一个完全不同的上下文,训练 word2vec 的上下文。在此示例中,您的句子将是“This is a which is”,这将是 Word2Vec 的训练句子。此外,如果您有很多不常用的单词,那么原本相距很远的单词现在会放在同一个上下文中。
这是对 Word2Vec 的正确解释吗?我们是否只是假设您的数据集中不应该有太多不常用的词(或设置较低的 min_count 阈值)?
【问题讨论】: