【发布时间】:2013-12-10 14:20:19
【问题描述】:
我有 800 万个独特的 user_id 到 item_id 配对,如下所示:
user_id item_id
1 item10
1 item11
1 item12
1 item13
2 item11
2 item13
2 item14
2 item15
3 item10
3 item14
3 item18
我想把它变成以下格式:node1,node2,weight 其中所有节点都是 user_ids,它们之间的权重是它们共享的 item_ids 的数量。因此,例如,1 和 2 是连接的,因为它们共享 2 个 item_id [item11 和 item13],并且 1 和 3 共享 1 个 item_id [item_10],2 和 3 也共享 1...等等。
1,2,2
1,3,1
2,3,1
将是我正在寻找的最终结果。但是,我有 800 万行(大约 25 个唯一的 user_id,但有很多连接)最有效的方法是什么?我用来从大约 50.000 行中检索类似(但不相同)网络的 SQL 查询需要很长时间,所以我正在寻找替代方案。我可以在 R、php、sql 或 python 中做到这一点。
【问题讨论】: