【发布时间】:2017-02-09 23:24:25
【问题描述】:
假设我已经根据一组哈希构建了一个 LSH 数据库,我现在开始查询该数据库以找到近似最近的邻居。
当您计算查询点的哈希并且相应的存储桶为空时,是否有任何指导方针?同样,假设我要找到 5 个近似最近邻,而桶中只有 4 个其他数据点?
【问题讨论】:
假设我已经根据一组哈希构建了一个 LSH 数据库,我现在开始查询该数据库以找到近似最近的邻居。
当您计算查询点的哈希并且相应的存储桶为空时,是否有任何指导方针?同样,假设我要找到 5 个近似最近邻,而桶中只有 4 个其他数据点?
【问题讨论】:
我认为检索点数太少意味着您的训练数据桶太多。当然,这取决于应用程序。看看LSH toolbox by Greg Shakhnarovich 的实现和他的README file。在这个实现中,更少的哈希函数(更小的 k)意味着更满的桶,而这反过来意味着更慢的 LSH。
【讨论】: