【发布时间】:2014-05-21 17:47:55
【问题描述】:
我正在实现一个近邻搜索应用程序,它将找到类似的文档。到目前为止,我已经阅读了很多 LSH 相关材料(LSH 背后的理论有点令人困惑,我还不能 100% 理解它)。
我的代码能够使用 minhash 函数计算签名矩阵(我快要结束了)。我还在签名矩阵上应用了条带策略。但是我无法理解如何将带中的签名向量(列)散列到桶中。
我的最后一个问题可能是最重要的,但我要问一些introduction 的问题:
q1:散列函数是否只会将 same 向量映射到同一个桶? (假设我们有足够的桶)
q2:散列函数是否应该将 similar 向量映射到同一个桶?如果是,那么这种相似性的程度/定义是什么,因为我不是在计算比较,而是在做散列。
q3:根据上面的问题,我应该使用什么样的哈希表算法?
q4:我认为我最弱的一点是我不知道如何生成一个以向量作为输入并选择一个桶作为输出的哈希函数。我可以根据 q1 和 q2 自己实现一个...关于为 LSH bucketing 生成哈希函数有什么建议吗?
【问题讨论】:
标签: c hash machine-learning locality-sensitive-hash minhash