【问题标题】:Which is a better input for an autoencoder, one with correlated features or one with uncorrelated features?对于自动编码器来说,哪个输入更好,一个具有相关特征还是一个具有不相关特征?
【发布时间】:2018-01-02 03:18:00
【问题描述】:

我正在尝试以 2D 形式可视化我的数据以检测欺诈(异常值),如果发生欺诈,我的所有特征都可能会采用更大的值。但我小心翼翼地不包含多余的功能,

例如特性: 活跃度(对于每天使用该服务的活跃用户而言,得分更高)和赚钱都倾向于在欺诈的情况下取更高的值,但不能从另一个中推断出一个。

我认为以这种方式选择特征将转化为 2D 表示中更大的坐标,并使欺诈点远离/从我的其余数据中脱颖而出。

我还觉得拥有相关特征会使自动编码器更容易重建数据。但我多次读到,具有相关特征在机器学习中效率不高。

我应该努力降低我的特征相关性吗?例如,将 Activity 分数(活跃用户较高)替换为两次使用之间的时间(活跃用户较低)?

或者这对自动编码器来说并不重要?

【问题讨论】:

    标签: correlation feature-selection autoencoder


    【解决方案1】:

    您的理解是正确的,即“具有相关特征将使自动编码器更容易重建数据”。

    例如,如果您的所有数据点都是 i.i.d。 Gaussian 它会使自动编码器的数据压缩变得非常困难,因为它们无法学习数据的低维表示。

    详情请参阅斯坦福 UFLDL 教程link

    【讨论】:

    • 即使没有链接,也请让您的答案有用
    猜你喜欢
    • 2019-05-30
    • 2018-12-01
    • 2011-12-23
    • 1970-01-01
    • 1970-01-01
    • 2020-11-25
    • 1970-01-01
    • 2021-03-01
    • 2021-12-17
    相关资源
    最近更新 更多