【问题标题】:Is having multiple features for the same data bad practice (e.g. use both ordinal and binarized time series data)?对同一数据使用多个特征是不好的做法(例如,同时使用序数和二值化时间序列数据)?
【发布时间】:2019-01-06 03:13:55
【问题描述】:

我正在尝试训练一个包含日期的房地产销售数据的学习模型。根据this thread 中的建议,我已经研究了 1 到 K 二进制编码,但是我最初的评估是它可能存在无法对不可预测的循环数据进行良好训练的弱点。虽然房地产价值崩溃正在反复发生,但我担心(可能是错误的,你告诉我)如果重复无法通过年月的组合来解释,那么进行 1 到 K 编码会无意中过度训练可能不相关的特征 -天。

也就是说,我认为这种方法具有潜在的价值。我认为将时间序列数据转换为序数的论点也有好处,正如在同一线程中所推荐的那样。这让我想到了一个真正的问题:在相同的训练数据中以两种不同的形式复制相同的初始特征(日期数据)是不好的做法吗?我担心如果我使用依赖于特征独立性假设的方法,这样做可能会违反这一点。

如果是这样,对于如何最好地从该日期数据中获取最大信息有什么建议?

编辑:请发表评论,我可以如何改进这个问题而不是投反对票。

【问题讨论】:

    标签: datetime machine-learning


    【解决方案1】:

    这是不好的做法吗?

    不,有时转换会使您的功能更容易被您的算法访问。遵循这一思路,您转换功能完全没问题。

    它会扭曲你的算法吗?

    关于运行时,最好不必每次都转换数据。根据您的算法,您可能会获得更差的可解释性(如果这对您很重要),具体取决于转换的类型。 此外,如果您想限制算法应使用的特征数量/集,您可以通过添加转换后的特征来添加信息冗余。

    那你该怎么办?

    随心所欲地转换您的数据/功能。 这不会伤害任何人,而是通过增加功能空间来提供帮助。但是在你这样做之后,做一个 PCA 或类似的事情,以便在你的特征中找到冗余并再次减少你的特征空间。

    注意:

    我尽量说得通,显然这在很大程度上取决于您使用的算法类型。

    【讨论】:

      猜你喜欢
      • 2017-12-14
      • 1970-01-01
      • 2019-03-11
      • 2019-10-12
      • 2021-04-23
      • 1970-01-01
      • 2018-03-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多