【问题标题】:How many and/or what criteria does CfsSubsetEvaluator use in selecting features in each step of cross-validation while doing feature selection?在进行特征选择时,CfsSubsetEvaluator 在交叉验证的每个步骤中使用多少和/或什么标准来选择特征?
【发布时间】:2018-03-04 12:51:16
【问题描述】:

我对@9​​87654321@ 很陌生,我有一个111 cases109 attributes 的数据集。我在 WEKA 中使用功能选择选项卡,CfsSubsetEvalBestFirst search method 用于feature selection。我正在使用leave-one-out cross-validation

那么,WEKA 选择了多少特征,或者该方法在交叉验证的每个步骤中选择的特征数量的停止标准是什么

谢谢,

戈皮

【问题讨论】:

    标签: machine-learning weka feature-selection


    【解决方案1】:

    CfsSubsetEval 算法正在搜索可以很好地协同工作的特征子集(特征之间的相关性低,与目标标签的相关性高)。子集的分数称为优点(您可以在输出中看到它)。

    BestFirst 搜索不允许您确定要选择的功能数量。但是,您可以使用其他方法,例如GreedyStepWise 或使用InformationGain/GainRatio 算法和Ranker,并定义特征集的大小。

    您可以用来影响集合大小的另一个选项是搜索的方向(向前、向后……)。

    祝你好运

    【讨论】:

    • 感谢您的解释。我还有一个疑问:在WEKA for BestFirst 搜索方法parameters 它说 searchTermination -- 指定在终止搜索之前允许的连续非改进节点的数量。这是否像交叉验证每个步骤中特征数量的停止标准。你能解释一下吗
    • 就像我说的,算法计算每个子集的“优点”分数。 BestFirst 几乎是贪婪的。如果先前的子集没有提高分数,则该参数确定尝试找到更好的子集的次数。当它到达一个子集时,它无法改进——它将停止并返回找到的最佳集合。
    猜你喜欢
    • 2013-11-08
    • 2015-11-13
    • 1970-01-01
    • 2017-07-07
    • 2020-07-31
    • 2020-07-10
    • 1970-01-01
    • 2020-08-13
    • 2016-08-30
    相关资源
    最近更新 更多