【发布时间】:2019-07-06 19:31:10
【问题描述】:
我有一个 CSV 文件 (main.csv),它有一个唯一的列 ID,它也与我的图像名称有关(减去它们的 .jpg 扩展名)。
我想做 10 次交叉验证并创建一个训练和测试 CSV,这样每次折叠的测试 CSV 将只包含原始 CSV 的 10%。
是否有一个简单的路径(已经完成)来做到这一点?
基本上,我希望我的最终训练和测试 CSV 文件具有相同的确切列名,但设计为我可以对它们执行 10 倍交叉验证(也就是随机抽样/随机抽样和 10% 选择)。
我不介意在 Python 或 R 中使用 pandas。
我不打算使用 Scikit-learn 进行交叉验证,因为我使用的是我自己的手动代码,这就是为什么我需要对每个折叠进行切碎的训练和测试 CSV。
【问题讨论】:
标签: python r csv machine-learning cross-validation