【发布时间】:2018-03-14 15:07:42
【问题描述】:
情景
我有一个数据集,其最后一列包含 NaN 值,需要仅使用向量余弦和皮尔逊相关进行估算;之后,数据将被进一步用于聚类。
问题
我的案例必须使用 VECTOR COSINE 和 PEARSON CORESATION。
这是我的数据集的一部分 post_df1 使用 pandas 从 csv 中获取
uid iid rat
1 303.0 785.0 3.000000
2 291.0 1042.0 4.000000
3 234.0 1184.0 2.000000
4 102.0 768.0 2.000000
254 944.0 170.0 5.000000
255 944.0 171.0 5.000000
256 944.0 172.0 NaN
257 944.0 173.0 NaN
258 944.0 174.0 NaN
现在使用此命令将其放入向量中(为了方便起见,需要建议)
vect_1 = post_df1.iloc[:, 2].values
然而,sklearn.preprocessing 的名为 Imputer 的类有 Mean, Median & Most frequent 方法可用,但根据我的场景将无法工作。
问题
- 除了SurPRISE(由 Nicholas Hug 提供)之外,还有其他适用于 Vector Cosine 和 Pearson 方法的包
- 是否可以在 sklearn 中为 cosine 和 pearson 传递函数/方法?
- 还有其他方法/出路吗?
【问题讨论】:
标签: python pandas scikit-learn sklearn-pandas imputation