【问题标题】:Question pairs (ground truth) datasets for Word2Vec model testing?Word2Vec 模型测试的问题对(基本事实)数据集?
【发布时间】:2019-11-08 17:40:47
【问题描述】:

我正在寻找测试数据集来优化我的 Word2Vec 模型。我从 gensim 找到了一个不错的:

gensim/test/test_data/questions-words.txt

有人知道其他类似的数据集吗?

谢谢!

【问题讨论】:

  • 欢迎来到 SO;请花一些时间阅读What topics can I ask about here?,并注意要求我们推荐或查找书籍、工具、软件库、教程或其他场外资源的问题与 SO 无关。

标签: machine-learning nlp word2vec word-embedding


【解决方案1】:

请务必注意,词向量并没有真正的“基本事实”。您可以使用它们来完成一些有趣的任务,并且单词向量的某些排列在特定任务上会比其他任务更好。

而且,在一项任务中表现最佳的词向量——例如以questions-words.txt 问题的风格解决类比问题——在另一项重要任务中可能不是最好的——比如为分类或信息建模文本-检索。

也就是说,您可以制作与questions-words.txt 相同格式的测试数据。谷歌最初的word2vec.c 版本,其中还包括一个将附近单词统计组合成多词短语的工具,还包括一个questions-phrases.txt 文件,格式相同,可用于测试构造相似的词向量对于实际上是简短的多词短语的“单词”。

Python gensim 词向量支持包括一个额外的方法,evaluate_word_pairs() 用于检查词向量,而不是类比求解,而是与人类确定的词相似度排名集合的一致性。该方法的文档包含指向该方法的相应测试集的链接,SimLex-999,您可以在其他地方找到相同格式的其他测试集。

但是,同样,这些都不应该被视为对词向量整体质量的绝对测试。对于您的特定项目对词向量的使用,最好的测试是您自己设计的一些可重复的特定领域评估分数,这与您的最终目标固有地相关。

【讨论】:

  • 非常感谢,您的回答真的很有帮助!!
猜你喜欢
  • 2019-10-23
  • 2014-12-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-12-23
  • 2014-11-21
  • 2021-06-29
  • 1970-01-01
相关资源
最近更新 更多