【发布时间】:2014-06-06 17:54:03
【问题描述】:
我必须经常在大型(高达 1G)格式的 CSV 数据库中搜索哈希
sha256_hash, md5_hash, sha1_hash, field1, field2, field3 etc
在 C 中。这需要非常快,并且内存使用不是问题(最低 32G)。我发现this 与我的想法非常接近:将数据加载到 RAM 中,按哈希对数据库进行一次性排序,按哈希的前 'n' 个字节索引,然后搜索较小的子列表。但是上面的线程似乎没有解决我中间的一个问题。由于我不是密码学专家,我想知道哈希的分布以及它是否可以用来更快地搜索子列表。关于这个或我的一般方法有什么建议吗?
【问题讨论】: