【问题标题】:Question pairs (ground truth) datasets for Word2Vec model testing?Word2Vec 模型测试的问题对(基本事实)数据集?
【发布时间】:2019-11-08 17:40:47
【问题描述】:
我正在寻找测试数据集来优化我的 Word2Vec 模型。我从 gensim 找到了一个不错的:
gensim/test/test_data/questions-words.txt
有人知道其他类似的数据集吗?
谢谢!
【问题讨论】:
标签:
machine-learning
nlp
word2vec
word-embedding
【解决方案1】:
请务必注意,词向量并没有真正的“基本事实”。您可以使用它们来完成一些有趣的任务,并且单词向量的某些排列在特定任务上会比其他任务更好。
而且,在一项任务中表现最佳的词向量——例如以questions-words.txt 问题的风格解决类比问题——在另一项重要任务中可能不是最好的——比如为分类或信息建模文本-检索。
也就是说,您可以制作与questions-words.txt 相同格式的测试数据。谷歌最初的word2vec.c 版本,其中还包括一个将附近单词统计组合成多词短语的工具,还包括一个questions-phrases.txt 文件,格式相同,可用于测试构造相似的词向量对于实际上是简短的多词短语的“单词”。
Python gensim 词向量支持包括一个额外的方法,evaluate_word_pairs() 用于检查词向量,而不是类比求解,而是与人类确定的词相似度排名集合的一致性。该方法的文档包含指向该方法的相应测试集的链接,SimLex-999,您可以在其他地方找到相同格式的其他测试集。
但是,同样,这些都不应该被视为对词向量整体质量的绝对测试。对于您的特定项目对词向量的使用,最好的测试是您自己设计的一些可重复的特定领域评估分数,这与您的最终目标固有地相关。