【发布时间】:2017-12-06 10:11:05
【问题描述】:
简报:
我正在使用 Movielens 100k Dataset 推荐电影。到目前为止,我已经完成了。
-
值的排序
df_sorted_values = df.sort_values(['UserID', 'MovieID']) print type(df_sorted_values) -
使用 NaN 值打印矩阵
df_matrix = df.pivot_table(values='Rating', index='UserID', columns='MovieID') -
对其进行了5折CV
reader = Reader(line_format="user item rating", sep='\t', rating_scale=(1,5)) df = Dataset.load_from_file('ml-100k/u.data', reader=reader) df.split(n_folds=5) -
我已经使用 SVD 评估了数据集
perf = evaluate(SVD(),df,measures=['RMSE','MAE']) print_perf(perf) 这里我需要使用相同包 (Surprise) 提供的使用相似性算法,它写为
surprise.cosine来预测缺失值。这表明它需要(*args,**kwargs)参数,但我对实际传递的内容一无所知。生成相似性后,我需要用现在预测的替换 NaN 值打印矩阵,稍后将用于推荐
附注我对来自 CRAB、RECSYS、PANDAS 和 GRAPHLAB 的不同解决方案持开放态度,前提是它们也可以在步骤 1 到 4 上解决
我过去的参考资料是:
【问题讨论】:
标签: python pandas sklearn-pandas graphlab