【发布时间】:2021-07-04 23:53:05
【问题描述】:
我有一个从s1 到s100 的样本池,我想在A 和B 两个不同类别之间进行分类
在这个问题中,我不能对每个样本单独执行预测,而是以 10 个为一组进行预测,并且每个预测都会返回预测的标签和每个标签的 置信度。比如:
[s1,s21,s3,s15,s5,s62,s90,s13,s9,s100];A;0.9
[s1,s5,s12,s20,s53,s89,s27,s42,s76,s55];A;0.4
...
每个预测向量都是随机设置的,我可以根据需要执行尽可能多的组合。此外,样本可以在池中重复多次。
我想要完成的是使用 置信度 标签对每个 category 预测的每个 sample 重要性进行排名
搜索类似的问题我最终认为计算shaply values 将是一个很好的解决方案,但这些被认为是针对特征而不是样本的实现。
有什么想法可以实现吗?
编辑:
按照建议,我将尝试添加一个最小的问题示例,每组 4 个样本和 2 个样本。比如:
Sample_group;Prediction;Confidence
[s1,s2];A;0.7
[s3,s4];A;0.6
[s1,s3];A;0.9
[s2,s4];A;0.5
[s1,s4];A;0.7
[s2,s3];A;0.6
尽管所有对都给出了相同的预测,但查看 confidence 值显示 [s1,s3] 对具有最高值,[s2,s4] 具有最低值。检查其余对可以推断出s1 值似乎是与s3 与其他两个配对时提供最高置信度的值。那么,结果应该是这样的:
Sample;rank
s1;0
s3;1
s2;2
s4;3
【问题讨论】:
-
感谢@SergeyBushmanov 的建议。我试图添加一个最小的例子
标签: python machine-learning game-theory shap