【问题标题】:Multivariate regression with variable size input可变大小输入的多元回归
【发布时间】:2019-05-19 15:16:48
【问题描述】:

我想拟合机器/深度学习模型以适应下表数据格式 F1-F5 是特征,Y 被捕获是一个随机的时间间隔。

F1    F2    F3    F4    F5    Y
11    12    13    14    15    
.                             
.                             
.                             
n1    n2    n3    n4    n5    2.3
n+11  n+12  n+13  n+14  n+15
.
.
n+x1  n+x2  n+x3  n+x4  n+x5  3.5

我很困惑是否采用 CNN 方法,将 1*5 大小的内核乘以 11-n1 的每一行,并尝试通过将 sum 与 Y 匹配来学习。 请建议我如何处理这些数据。

注意: F1 - F5 是记录数据的传感器,每个传感器都有明确的用途。

【问题讨论】:

  • 你的预测变量肯定不是独立的,先去除多重共线性,然后使用随机森林,或者如果它的线性就用LR
  • @Oswald 你的意思是,将特征空间 F1-F5 减少到单个 F1?如果是这种情况,F1 - F5 是记录数据的传感器,每个传感器都有明确的用途。所以我相信在这种情况下不能有多重共线性。
  • 无论传感器有什么用途,所有列都高度相关(至少,它在您显示的数据中看起来像)
  • 这里提供的数据是模拟的,只是为了给出格式的想法。预测变量是独立的,不幸的是我不能共享数据,因为它很敏感。还有其他方法吗?

标签: machine-learning deep-learning regression


【解决方案1】:

如果你的特征不相关,那么你必须使用所有五个特征。但是仍然五个不大,所以你不需要去CNN。 CNN 用于图像中,以减少图像中大量特征所需的参数数量。一张 200*200 的图像有 40000 个特征,如果我们构建一个神经网络,我们可能需要十万甚至数百万的参数。这就是我们在这种情况下选择 CNN 的原因。但在你的情况下,你只有 5 个特征,所以我认为使用简单的神经网络而不是 CNN 更好。

【讨论】:

    猜你喜欢
    • 2021-10-08
    • 2013-07-01
    • 1970-01-01
    • 2015-07-03
    • 2018-09-24
    • 1970-01-01
    • 2018-07-25
    • 2016-04-14
    • 1970-01-01
    相关资源
    最近更新 更多