【问题标题】:Evaluating Glove model by finding linear algebraic structure of words通过寻找单词的线性代数结构来评估 Glove 模型
【发布时间】:2017-08-15 17:26:28
【问题描述】:

我已经在我的文本语料库上使用 c 应用程序构建了 Glove 模型,遵循这个实现 https://github.com/stanfordnlp/GloVe/tree/master/src。 我想以这样的方式找到词嵌入

如果A与B相关,C与D相关,那么A-C+B应该相等 到 D. 例如,嵌入向量算术 “澳大利亚”-“堪培拉”+“印度”应该等于嵌入 “新德里”。

我想在 python 中评估这些嵌入。

【问题讨论】:

    标签: python nlp stanford-nlp word-embedding


    【解决方案1】:

    任何A B C D的评估步骤:

    1. D' = A-C+B计算D'的向量表示。
    2. 对于训练好的 GloV 中的所有词向量 v,计算 vD' 的余弦相似度。
    3. 检查与D' 最相似的向量是否实际上是预期词D

    这样的结果可以被视为@top1 类信息检索的评估。可以改第三步获取@top k

    【讨论】:

    • 生成词汇文件时的最大词汇计数参数是否与词向量维度参数相关联?我在评估时遇到错误**无法将 66 序列的数组复制到维度 100 的向量**
    猜你喜欢
    • 1970-01-01
    • 2020-01-28
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多