【问题标题】:How to retrofit a fasttext model?如何改造 fasttext 模型?
【发布时间】:2021-09-07 00:57:14
【问题描述】:

我阅读了各种研究论文,可以改进 fasttext 模型以提高其准确性 (https://github.com/mfaruqui/retrofitting)。但是我在如何实现它时遇到了麻烦。

上面的 github 链接,将获取一个矢量文件并对其进行改造,输出另一个矢量文件。我可以使用 gensim 库加载它。但是,由于它是一个向量文件,它不再是一个模型,并且它不会预测 OOV(out-of-vocabulary)单词。这使它毫无意义。有没有办法以某种方式重新训练模型以使其具有更好的准确性?

【问题讨论】:

    标签: python gensim fasttext


    【解决方案1】:

    据我了解,通过阅读paper 和浏览repository建议的方法仅允许提高输入中给出的向量的质量 (.vec)。 p>

    如您所见here,fastText 表示词汇外单词的能力是 .bin 模型(其中包含所有 n-gram 的向量)所固有的。

    您也可能已经理解,使用建议的方法来改造 fastText 模型没有开箱即用的方法。

    【讨论】:

    • 确实,该方法只适用于一组固定的向量——而不是一个完整的 FastText 模型,以及它的所有子词信息。但是对于提问者的一个想法:如果有一些您最感兴趣的固定 OOV 词集——也许是那些在词典中命名的词——你可以想象得到所有个感兴趣的词(包括 in-vocab 和OOV)来自 FT 模型,将它们放在静态 .vec 文件中,然后尝试该技术。您将没有完整的 FastText 模型 - 但您将拥有所有新的改进向量,用于固定的感兴趣词列表。
    猜你喜欢
    • 2018-10-14
    • 2018-06-09
    • 2021-03-29
    • 2020-02-08
    • 2019-02-04
    • 1970-01-01
    • 2021-11-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多