【问题标题】:How to use k means for a product recommendation dataset如何将 k 均值用于产品推荐数据集
【发布时间】:2019-10-31 16:27:41
【问题描述】:

我有一个数据集,其列标题为产品名称、品牌、评级 (1:5)、评论文本、评论帮助。我需要的是使用评论提出推荐算法。我必须在这里使用 python 进行编码。数据集为 .csv 格式。

要识别数据集的性质,我需要对数据集使用 kmeans。如何在这个数据集上使用 k 均值?

所以我做了以下,
1.数据预处理,
2.review文本数据清理,
3.情绪分析,
4.根据他们获得的情绪值(通过情绪分析给出)给出从 1 到 5 的情绪评分,并将评论标记为非常负面、负面、中性、正面、非常正面。

在这些程序之后,我的数据集中有这些列,产品名称、品牌、评级 (1:5)、评论文本、评论帮助性、情绪值、情绪标签。 这是数据集https://drive.google.com/file/d/1YhCJNvV2BQk0T7PbPoR746DCL6tYmH7l/view?usp=sharing的链接

我尝试使用以下代码获取 k 表示它运行时没有错误。但我不知道这是有用的东西,或者有没有其他方法可以在这个数据集上使用 kmeans 来获得一些其他有用的输出。为了更多地了解数据,我应该如何在这个数据集中使用 k 均值..

import pandas as pd
import numpy as np
from sklearn.cluster import KMeans
import matplotlib.pyplot as plt
df.info()
X = np.array(df.drop(['sentiment_value'], 1).astype(float))
y = np.array(df['rating'])
kmeans = KMeans(n_clusters=2)
kmeans.fit(X)
KMeans(algorithm='auto', copy_x=True, init='k-means++', max_iter=300,
    n_clusters=2, n_init=10, n_jobs=1, precompute_distances='auto',
    random_state=None, tol=0.0001, verbose=0)
plt.show()

【问题讨论】:

标签: python data-mining k-means recommendation-engine sklearn-pandas


【解决方案1】:

除非您更具体地说明您想要实现的目标,否则我们将无法提供帮助。弄清楚你到底想预测什么。您只是想根据不太有希望的情绪得分对产品进行聚类,还是想在新数据集上预测实际的产品偏好?

如果您想构建推荐系统,唯一的可能性(考虑您的数据集)是根据评级/情绪识别类似产品。那是你要的吗?

【讨论】:

    【解决方案2】:

    你什么都没画。

    所以什么都没有出现。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2010-10-22
      • 1970-01-01
      • 2014-07-21
      • 2011-10-07
      • 1970-01-01
      • 1970-01-01
      • 2020-07-07
      相关资源
      最近更新 更多