【发布时间】:2016-05-27 17:58:40
【问题描述】:
据我所知,大多数公开可用的嵌入都是通过新闻文章完成的,这些文章使用与用户/客户评论中使用的语言/单词不同的语言/单词。
尽管此类嵌入可用于涉及评论的 NLP 任务 和用户生成的内容,我认为语言的差异起着重要作用,因此我宁愿使用经过用户生成的内容(例如产品评论)训练的嵌入。
我正在寻找英语评论或 cmets 语料库(尽管德语和荷兰语也很有用)来生成嵌入,或者已经在此类语料库上训练过的嵌入。
【问题讨论】:
-
只是出于好奇,您所说的“嵌入”是什么意思?
-
任何语言建模和特征学习技术,其中单词被映射到相对于词汇量大小的低维空间中的实数向量,例如:Google 的 Word2vec 或斯坦福大学的 GloVe
-
谢谢,这很有道理!根据此引用 (source) Word2vec 创建的向量是单词特征的分布式数字表示,诸如单个单词的上下文等特征。 那么这些是单词频率、搭配等的向量吗?就像一个特征矩阵,但可能将不同的类别混合在一起?只是想了解它们与 NLP 中常用的计数、频率的“标准”向量有何不同......
-
看看这个来自 Mikolov 的tutorial/presentation,他是 word2vec 的作者(即 CBOW 和 Skip-Gram 模型)