【发布时间】:2018-05-26 17:54:39
【问题描述】:
我看到很多论文解释了在使用 CNN 的句子情感分类中使用预训练的词嵌入(例如 Word2Vec 或 Fasttext)(例如 Yoon Kim 的论文)。但是,这些分类器也说明了单词出现的顺序。
我的词嵌入应用是预测词“池”的类别。例如,在以下列表列表中
example = [["red", "blue", "green", "orange"], ["bear", "horse", "cow"], ["brown", "pink"]]
单词的顺序无关紧要,但我想将子列表分类为颜色或动物类别。
是否有任何预先构建的 Keras 实现,或者您可以指出任何论文来解决基于预训练词嵌入的此类分类问题?
如果这与本论坛的主题无关,我很抱歉。如果是这样,请让我知道在哪里发布它会更好。
【问题讨论】:
-
你有这些对应的标签吗,也许是数据集?因为你可以在没有任何深度学习的情况下解决这个问题,只需要 word2vec,因为颜色已经聚集,动物也会聚集。您可以使用向量的点积和分类来检查单词最相似的池。
-
@nuric 是的,这是一个非常简单的示例来演示我的任务的想法,但我的应用程序并不那么简单。我有一个带有单词列表的训练集(随机顺序,每个列表包含大约 100,000 个单词,并且列表中的所有单词都不是,例如,所有关于颜色或动物的)以及类标签,以及一个验证集。因此,我一直在寻找深度学习解决方案,因为简单地查看余弦相似度是行不通的。
-
您可以使用 gensim 库训练 Word2Vec。除此之外,您可以使用单热编码器和词袋来完成任务,因为正如您所说,顺序并不重要。
标签: python nlp keras deep-learning conv-neural-network