【问题标题】:Pre Processing spiral dataset to use for Logistic Regression预处理螺旋数据集以用于逻辑回归
【发布时间】:2021-09-21 04:38:11
【问题描述】:

所以我需要对螺旋数据集进行分类。我一直在试验一堆算法,比如 KNN、Kernel SVM 等。我想尝试使用特征工程、预处理等来提高 Logistic Regression 的性能。

我也在使用 scikit learn 来做所有的分类。

我完全理解逻辑回归不是解决这类问题的合适算法。这更像是一个关于预处理和其他特征工程/提取方法的学习练习,看看我可以在多大程度上改进这个特定的模型。

这是我将用于分类的示例数据集。任何关于我如何操作数据集以在逻辑回归算法中使用的建议都会有所帮助。

我也有多个螺旋的数据集。一些数据集有 2 个类,有时最多 5 个。这意味着最多 5 个螺旋。

【问题讨论】:

    标签: python machine-learning scikit-learn preprocessor


    【解决方案1】:

    逻辑回归通常用作线性分类器,即将一个类样本与另一类样本分开的决策边界是线性的(直线),但它也可以用于非线性决策边界。

    在 SVC 中使用核技巧也是不错的选择,因为它将低维数据映射到高维数据,使其成为线性可分的。

    示例:

    在上面的例子中,数据在低维上不是线性可分的,但是在应用变换 φ(x) = x² 并将第二维添加到特征之后,我们得到了右侧的图,该图变为线性可分的。

    您可以通过创建用于应用逻辑回归的新功能来开始转换数据。 还可以尝试使用内核技巧的 SVC(支持向量分类器)。对于 SVC,您不必将数据显式转换为更高维度。

    onetwo 是少数非常适合学习的资源

    【讨论】:

      【解决方案2】:

      由于数据似乎不是线性可分的,您可以尝试使用支持向量分类中常用的 Kernel Trick 方法。核函数接受原始低维空间中的输入,并返回高维空间中变换向量的点积。这意味着变换后的向量 φ(x) 只是对应的低维向量 x 中坐标的一些函数。

      【讨论】:

      • 您能否详细解释一下工作流程,并可能更具体地介绍预处理数据集的某些算法?这种方法是否也专门用于转换要用于逻辑回归的数据?
      • 逻辑回归通常用作线性分类器,即将一个类样本与另一个类样本分开的决策边界是线性的(直线),但它也可用于非线性决策边界。您可以从现有特征中创建更多特征
      猜你喜欢
      • 2018-05-06
      • 2020-08-24
      • 2016-09-13
      • 1970-01-01
      • 2017-01-15
      • 1970-01-01
      • 2021-09-28
      • 2017-01-19
      • 2020-07-17
      相关资源
      最近更新 更多