【发布时间】:2021-10-26 03:37:35
【问题描述】:
FastText.wv.save_word2vec_format() 在一行中创建了一些包含两个单词的条目。这是一个问题,因为它破坏了KeyedVectors.load_word2vec_format() 函数,该函数需要一个单词后跟x 浮点数,其中x 是向量中的维数。我无法证明这是一个错误,那么有人遇到过这个问题吗?
我的解决方案是通过删除包含两个空格分隔的单词的行来修剪生成的文件。在我使用的大型数据集中,每个数据集出现 3 到 10 次。我还仔细检查了词汇表中没有单词,数据集中没有单词包含空格。
在每次出现时,两个组成词都有自己的条目作为一个词。这可能是针对特别高的同时出现的对吗? 这是预期的行为吗?如果是这样,为什么?为什么在加载函数中没有考虑到这一点?
【问题讨论】: