【发布时间】:2020-12-11 15:53:38
【问题描述】:
我想使用预定义的比率将一个列表拆分为 3 个子列表(训练、验证、测试)。项目应随机选择到子列表中,不重复。 (我的第一个列表包含拆分后要处理的文件夹中的图像名称。) 我找到了一种工作方法,但似乎很复杂。我很好奇有没有更简单的方法来做到这一点? 我的方法是:
- 列出文件夹中的文件,
- 定义子列表的必要大小,
- 随机填写第一个子列表,
- 从原始列表中删除使用过的项目,
- 从剩余列表中随机填写第二个子列表,
- 删除使用过的项目,得到第三个子列表。
这是我的代码:
import random
import os
# list files in folder
files = os.listdir("C:/.../my_folder")
# define the size of the sets: ~30% validation, ~20% test, ~50% training (remaining goes to training set)
validation_count = int(0.3 * len(files))
test_count = int(0.2 * len(files))
training_count = len(files) - validation_count - test_count
# randomly choose ~20% of files to test set
test_set = random.sample(files, k = test_count)
# remove already chosen files from original list
files_wo_test_set = [f for f in files if f not in test_set]
# randomly chose ~30% of remaining files to validation set
validation_set = random.sample(files_wo_test_set, k = validation_count)
# the remaining files going into the training set
training_set = [f for f in files_wo_test_set if f not in validation_set]
【问题讨论】:
-
这对我来说似乎很干净
-
那么,问题出在哪里?
-
@mece1390 操作人员想要一种更清洁的方式
-
当他/她说我找到了一个工作方法但它很复杂时,清洁工是什么意思?什么元素使它更干净?是什么因素使它变得复杂?
-
您好,感谢 cmets。我已经得到了 2 个在我看来更简单和优雅的答案,这是我的目标。感谢您的回答!