【发布时间】:2020-09-20 18:03:32
【问题描述】:
如何将数据集拆分为训练数据并将测试数据拆分为使用日期的行,例如前 90%(从 2018-01-01 到 2019-02-01)将是训练数据和最后 10%(从 2019-02-02)将是python中的测试数据?不随机分裂?
【问题讨论】:
-
我相信这个
df_train = df[df['date'] < '2019-02-01']和这个df_test = df[df['date'] > '2019-02-02']应该可以解决问题 -
@Louis this code --> from sklearn.model_selection import train_test_split train_features, test_features, train_labels,test_labels = train_test_split(features, labels,test_size = 0.25, random_state = 42)拆分数据,我想要类似的东西,但使用日期拆分数据。
-
如果您按日期订购数据框,然后使用
sklearn.train_test_split并将参数shuffle设置为False它应该可以让您获得所需的结果。
标签: python pandas data-science random-forest