【发布时间】:2020-01-10 11:50:39
【问题描述】:
我想使用他们的个人/组织数据(例如部门、公司、站点等)找出哪些用户彼此相似。
我有这个布尔格式的数据,如下图:
Dep1 Dep2 Comp1 Comp2 Site1 Site2
U1 0 1 0 1 0 1
U2 1 0 0 1 1 0
U3 1 0 1 0 1 0
U4 0 1 0 1 0 1
U5 0 1 0 1 1 0
U6 1 0 1 0 0 1
我想选择一个用户并识别与他们相似的其他用户,以便我可以向他们推荐那些相似用户正在使用的软件/硬件。
我研究了余弦和 Jaccard 相似度,但在布尔数据上计算它们时没有看到太多帮助。
我正在使用 Python,对这门语言并不陌生,但我对数据分析和机器学习还很陌生。任何建议表示赞赏!
【问题讨论】:
-
您可以只计算相等的列数。所以 U1 和 U2 之间的相似度分数只有 1,U2 和 U3 之间的相似度分数是 2 等等。
-
如果您想根据文本查找相似性,Word2Vec 可能会帮助您。 Word Embedding的应用:>>情感分析>>语音识别>>信息检索>>问答
-
@DaanKlijn 我想这可能是一个很好的解决方案。我有一个包含 3000 多列和 61k 行的数据框,因此它可能是一个相当密集的算法。你对如何去做有什么建议吗?
标签: python machine-learning data-science similarity cosine-similarity