【发布时间】:2016-09-04 00:00:00
【问题描述】:
我有一个大型数据集,想将数据集随机分成 70% 的训练、25% 的测试和 5% 的开发。如何在 Python 中使用 scikit-learn 做到这一点?
我想知道我们是否像以下链接中的示例那样使用 sklearn.cross_validation.train_test_split(*arrays, **options) 函数来执行此操作?
http://scikit-learn.org/stable/modules/generated/sklearn.cross_validation.train_test_split.html
【问题讨论】:
-
我认为我们没有直接的方法或 API 来做同样的事情。但是,您可以进行双重拆分。首先使用 30% 的 train_test_split 作为测试。现在在这个新的测试数据上,再进行一次拆分,测试大小为 5%,以获得开发拆分。
-
也许函数 random.shuffle 有帮助?接下来,您可以简单地将您的集合切成 0.7、0.95 等。
标签: python machine-learning scikit-learn