【发布时间】:2021-04-14 11:24:25
【问题描述】:
在将我的数据拆分为 80/20 训练/验证集时,我正在寻求在各种数据集中平均分布我的样本。我不想随机进行,因为我需要在两组中平均分配样本并避免产生偏差。但是,我想确保对于每个类别的标签,80% 的样本都在训练集中。
有了这个,我想尝试在 R 的 caret 包中执行此操作,例如:
data_split <- createDataPartition(y=data$column, p=0.8, list=F) #splits data
training <- data[data_split,] #call training data
testing <- data[-data_split,] #call testing or validation data
例如我有 64 个班级,并且正在考虑对每个班级进行随机数据分区。
这是正确的吗?
【问题讨论】:
-
您发布的代码中的类分布如何?
标签: r machine-learning r-caret