【发布时间】:2012-06-22 10:06:03
【问题描述】:
liblinear 和 nltk 等机器学习包中的分类器提供了一个方法show_most_informative_features(),这对调试功能非常有帮助:
viagra = None ok : spam = 4.5 : 1.0
hello = True ok : spam = 4.5 : 1.0
hello = None spam : ok = 3.3 : 1.0
viagra = True spam : ok = 3.3 : 1.0
casino = True spam : ok = 2.0 : 1.0
casino = None ok : spam = 1.5 : 1.0
我的问题是是否为 scikit-learn 中的分类器实现了类似的功能。我搜索了文档,但找不到类似的东西。
如果还没有这样的功能,有人知道如何获得这些值吗?
【问题讨论】:
-
你的意思是最有区别的参数?
-
我不确定你的参数是什么意思。我的意思是最具辨别力的特征,比如在垃圾邮件分类的词袋模型中,哪些词为每个类别提供了最多的证据。不是我理解为分类器“设置”的参数——比如学习率等。
-
@eowl:在机器学习用语中,参数是学习过程根据你的训练集的特征生成的设置。学习率等是超参数。
标签: python machine-learning classification scikit-learn