【发布时间】:2021-11-10 02:27:11
【问题描述】:
我在python中实现了一个倒排索引,它本质上是一个字典,它的键是语料库中的单词,值是包含键出现的文档的元组及其bm25分数。
{
"love": [(doc1, 12), (doc3, 7.9), (doc5, 6.5)],
"hate": [(doc2, 8.7), (doc4, 3.2)]
}
但是,当我处理查询时,我发现很难从倒排索引的效率中受益,因为我必须迭代查询中的所有单词在一个 for 循环中。在这个循环中,我必须进一步循环单词链接的文档,并为所有文档维护一个全局评分表。
我认为这不是最佳方式。一些加快速度的想法?我认为接受多个键并并行返回多个值的批处理字典会有所帮助。
【问题讨论】:
-
你想用这个数据结构做什么?什么是“查询”?
标签: python inverted-index