【发布时间】:2016-06-24 09:47:10
【问题描述】:
我正在使用来自spark.ml 的 ALS 模型来创建推荐系统
对特定的项目集合使用隐式反馈。我注意到了
模型的输出预测值远低于 1,并且通常在 [0,0.1] 的区间内。因此,使用 MAE 或 MSE 不会使任何
在这种情况下有意义。
因此我使用 areaUnderROC (AUC) 来衡量性能。我通过使用 spark 的 BinaryClassificationEvaluator 来做到这一点,我确实得到了接近 0.8 的结果。但是,我无法清楚地理解这是怎么可能的,因为大多数值都在 [0,0.1] 范围内。
据我了解,在某一点之后,评估者将考虑所有预测都属于第 0 类。这基本上意味着 AUC 将等于负样本的百分比?
一般来说,如果您需要测试模型的性能(与逻辑回归相比),您将如何处理如此低的值?
我训练模型如下:
rank = 25
alpha = 1.0
numIterations = 10
als = ALS(rank=rank, maxIter=numIterations, alpha=alpha, userCol="id", itemCol="itemid", ratingCol="response", implicitPrefs=True, nonnegative=True)
als.setRegParam(0.01)
model = als.fit(train)
【问题讨论】:
标签: apache-spark machine-learning pyspark