【发布时间】:2020-06-07 20:54:21
【问题描述】:
我在 python 中编写了一个算法,用于索引大约 500 个文本文件(有些大于 2 MB)中的每个单词,以便在我的应用程序的搜索引擎中使用。索引文件是基于 json 的,即 {key:value} 结构。索引的数据是:文件ID、段落ID和行号。这是为每个单词完成的。相似词组合在一起。
问题是索引文件变得相对较大(超过行数据的两倍),这会增加我的应用程序的大小。该应用程序在没有互联网的情况下使用,因此必须在其中发送索引文件。
这是我第一次搞砸这样的事情,所以我想知道是否有办法减少大小,例如,使用 json 以外的其他数据库结构、放置索引文件的最佳格式或其他任何东西。
提前致谢。
【问题讨论】:
-
你可以看看我的建议
-
段落 ID 似乎是多余的。可以从文件 ID 和行号推断出来。另外,您是否使用该应用传送原始数据?
-
@user58697 这是一个诗歌应用程序,我指的是诗歌段落。它应该被编入索引。
标签: python json algorithm indexing full-text-search