【发布时间】:2018-01-02 03:18:00
【问题描述】:
我正在尝试以 2D 形式可视化我的数据以检测欺诈(异常值),如果发生欺诈,我的所有特征都可能会采用更大的值。但我小心翼翼地不包含多余的功能,
例如特性: 活跃度(对于每天使用该服务的活跃用户而言,得分更高)和赚钱都倾向于在欺诈的情况下取更高的值,但不能从另一个中推断出一个。
我认为以这种方式选择特征将转化为 2D 表示中更大的坐标,并使欺诈点远离/从我的其余数据中脱颖而出。
我还觉得拥有相关特征会使自动编码器更容易重建数据。但我多次读到,具有相关特征在机器学习中效率不高。
我应该努力降低我的特征相关性吗?例如,将 Activity 分数(活跃用户较高)替换为两次使用之间的时间(活跃用户较低)?
或者这对自动编码器来说并不重要?
【问题讨论】:
标签: correlation feature-selection autoencoder