【问题标题】:What is the proper way of using featuretools for single table data?将特征工具用于单表数据的正确方法是什么?
【发布时间】:2020-06-06 05:13:14
【问题描述】:

假设我有一个由单表组成的数据集,例如你可以考虑 kaggle 上的 Titanic 数据集。

现在,使用功能工具获得最大收益的正确方法是什么?因为 featuretools 专门用于关系数据。

现在“正确”的意思是,我知道在创建实体集时,索引参数将只是数据集的索引,但是在规范化实体时我的新索引应该是什么?也可以盲目使用RFE进行特征选择吗?

【问题讨论】:

    标签: data-science feature-selection feature-engineering featuretools


    【解决方案1】:

    您可以通过规范化实体集从 Featuretools 中获得最大收益。实体集越规范化,DFS 就越能利用关系结构生成更好的特征。

    标准化过程的目标是消除冗余数据。因此,具有附加变量的新索引应该有助于实现这一目标。这个guide 更深入地介绍了从非规范化表创建实体。

    对于特征选择,我认为可以明智地使用 RFE,以提高准确性并降低模型的复杂性。

    【讨论】:

    • 感谢您的回答。我应该标准化所有变量吗?例如,我现在在规范化时用PassengerIds 设置实体,我应该用所有列一次又一次地规范化它?或者我应该只选择一个?如果只有一个,应该是什么?
    • 我会尝试规范化多个冗余变量,例如 Ticket Class (pclass) 和 Port of Embarkation (embarked)。这将需要进行实验,以查看哪些列对您的用例产生最佳结果。
    猜你喜欢
    • 2023-02-03
    • 2017-09-09
    • 1970-01-01
    • 1970-01-01
    • 2013-11-29
    • 1970-01-01
    • 2015-11-23
    • 1970-01-01
    • 2019-12-29
    相关资源
    最近更新 更多