【发布时间】:2016-03-18 06:06:57
【问题描述】:
我正在处理大数据,我想找到重要的特征。 由于我是生物学家,所以请原谅我缺乏知识。
我的数据集有大约 5000 个属性和 500 个样本,它们具有二进制类 0 和 1。此外,数据集是有偏差的 - 样本大约有 400 个 0 和 100 个 1。 我想找到一些对确定类影响最大的特征。
A1 A2 A3 ... Gn Class
S1 1.0 0.8 -0.1 ... 1.0 0
S2 0.8 0.4 0.9 ... 1.0 0
S3 -1.0 -0.5 -0.8 ... 1.0 1
...
由于我从上一个问题中得到了一些建议,我正在尝试使用 L1 惩罚的 Lasso 回归来找到其作为重要特征的属性系数,因为它使不重要特征的得分为 0。
我正在使用 scikit-learn 库来完成这项工作。
所以,我的问题是这样的。
我可以对 biased 二元类使用 Lasso 回归吗?如果不是,虽然不使用 L1 惩罚,但使用 Logistic 回归是否是一个很好的解决方案?
如何使用 LassoCV 找到 alpha 的最佳值?文档说LassoCV支持,但是找不到功能。
这种分类还有其他好办法吗?
非常感谢。
【问题讨论】:
标签: python machine-learning scikit-learn classification regression