【发布时间】:2019-10-16 18:28:16
【问题描述】:
我正在尝试构建一个机器学习模型来预测每个社区在一段时间内的 VAR1。使用时间序列数据(年和月)。但是,数据包含许多邻域(这是分析的基础)。因此,每个社区将重复 3 年 * 12 个月 = 36 次。
我需要将此数据与其他数据集合并。所有其他数据集都具有相同数量的区域,并且有年份但没有月份。
我需要有关如何将这些数据集连接在一起并进行分析的帮助。我在 R 工作。
在加入数据集时,我会尝试将其他数据集中的行转移到列中,这样每个区域的实例就会更少。
以下是一些数据集的头部示例(在 R 中):
head(df)
Year Month District Neighborhood Gender VAR1
1 2017 January 1 1 M 2000
2 2017 January 1 2 M 350
3 2017 January 1 3 M 700
4 2017 January 1 4 M 400
5 2017 January 2 5 M 1000
6 2017 January 2 6 M 200
tail(df)
Year Month District Neighborhood Gender VAR1
10577 2015 December 10 69 F 200
10578 2015 December 10 70 F 1000
10579 2015 December 10 71 F 500
10580 2015 December 10 72 F 350
10581 2015 December 10 73 F 300
10582 2015 December 99 99 F 770
我在两件事上需要帮助:
首先,我需要知道如何将上面的示例与其他没有月份的数据集合并。
我被困在如何进行 EDA 和分析此数据集上,希望能得到帮助。
【问题讨论】:
标签: r machine-learning time-series data-analysis data-manipulation