【发布时间】:2016-08-28 23:11:49
【问题描述】:
给定包含以下信息的 10 亿条记录:
ID x1 x2 x3 ... x100
1 0.1 0.12 1.3 ... -2.00
2 -1 1.2 2 ... 3
...
对于上面的每个 ID,我想根据向量的欧几里德距离 (x1, x2, ..., x100) 找到前 10 个最接近的 ID。
计算这个的最佳方法是什么?
【问题讨论】:
-
你试过什么?我们要求您向我们展示您迄今为止所做的尝试,当您遇到错误或不理解错误并且文档无法提供帮助时,我们将在这里尝试。此外,包含便于其他用户复制和粘贴到自己环境中的示例数据也很重要,这样他们就可以在自己的环境中进行操作。
标签: apache-spark pyspark spark-dataframe nearest-neighbor euclidean-distance