【问题标题】:Inverted Index Speed Up倒排索引加速
【发布时间】:2021-11-10 02:27:11
【问题描述】:

我在python中实现了一个倒排索引,它本质上是一个字典,它的键是语料库中的单词,值是包含键出现的文档的元组及其bm25分数。

{
"love": [(doc1, 12), (doc3, 7.9), (doc5, 6.5)],
"hate": [(doc2, 8.7), (doc4, 3.2)]
}

但是,当我处理查询时,我发现很难从倒排索引的效率中受益,因为我必须迭代查询中的所有单词在一个 for 循环中。在这个循环中,我必须进一步循环单词链接的文档,并为所有文档维护一个全局评分表。

我认为这不是最佳方式。一些加快速度的想法?我认为接受多个键并并行返回多个值的批处理字典会有所帮助。

【问题讨论】:

  • 你想用这个数据结构做什么?什么是“查询”?

标签: python inverted-index


【解决方案1】:

如果将倒排索引表示为矩阵,尤其是稀疏矩阵,其中行是语料库,列是每个文档,应该会更有效。

【讨论】:

    猜你喜欢
    • 2011-09-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-07-07
    • 2014-11-12
    相关资源
    最近更新 更多