【发布时间】:2019-01-06 03:13:55
【问题描述】:
我正在尝试训练一个包含日期的房地产销售数据的学习模型。根据this thread 中的建议,我已经研究了 1 到 K 二进制编码,但是我最初的评估是它可能存在无法对不可预测的循环数据进行良好训练的弱点。虽然房地产价值崩溃正在反复发生,但我担心(可能是错误的,你告诉我)如果重复无法通过年月的组合来解释,那么进行 1 到 K 编码会无意中过度训练可能不相关的特征 -天。
也就是说,我认为这种方法具有潜在的价值。我认为将时间序列数据转换为序数的论点也有好处,正如在同一线程中所推荐的那样。这让我想到了一个真正的问题:在相同的训练数据中以两种不同的形式复制相同的初始特征(日期数据)是不好的做法吗?我担心如果我使用依赖于特征独立性假设的方法,这样做可能会违反这一点。
如果是这样,对于如何最好地从该日期数据中获取最大信息有什么建议?
编辑:请发表评论,我可以如何改进这个问题而不是投反对票。
【问题讨论】: