【发布时间】:2018-05-29 08:02:10
【问题描述】:
根据原论文Distributed Representations of Sentences and Documents,对看不见的段落的推断可以通过
训练“推理阶段”以获得新的段落向量 D 段落(以前从未见过)通过添加更多列 在 D 和梯度下降 D 同时保持 W, U, b 固定
这个推理阶段可以在 gensim 中由 infer_vector() 完成。
如果我有 window = 5 用于 doc2vec 模型,并尝试推断其某些句子为 len(sentence) < 5 的段落。
如:
model = Doc2Vec(window=5)
paragraph = [['I', 'am', 'groot'], ['I', 'am', 'groot', 'I', 'am', 'groot']]
model.infer_vector(paragraph)
在这种情况下,我是否应该用特殊的 NULL 词符号预先填充我的推断向量,以便段落中的所有句子长度都应该大于窗口大小?
如:
paragraph = [['I', 'am', 'groot', NULL, NULL], ['I', 'am', 'groot', 'I', 'am', 'groot']]
【问题讨论】: