【发布时间】:2016-07-20 20:05:40
【问题描述】:
使用caret 包,在创建数据分区时 75% 训练和 25% 测试,我们使用:
inTrain<- createDataPartition(y=spam$type,p=0.75, list=FALSE)
注意:数据集命名为spam,目标变量命名为type
我的问题是,包含y=spam$type 参数的目的是什么?
创建数据分区的目的不就是为了根据训练与测试所需的比例分割整个数据集吗?为什么需要在代码中包含该参数?
【问题讨论】:
-
不是 100%,但我相信这只是为了告诉命令您对数据进行分区的变量。除了阐明如何分区外,我不确定它是否重要 - 计算机更容易理解
-
你从哪里得到这个函数'createDataPartition'? 'str(inTrain)' 输出什么?
-
@a.powell “告诉..您通过什么变量对数据进行分区”是什么意思?我对分区的理解只是将整个数据进行拆分。为什么我们要在这个阶段提出“类型”是我的目标变量这一事实?我是否在概念上误解了数据分区的概念?
-
不,你是对的,但软件可能不像你那么直观。该命令只允许它从该类中获取随机样本。
-
@Zhenyuan Li 好吧,我确实阅读了文档,但它并没有让我清楚地了解这个具体问题。为什么你会认为我没有这样做?我的问题对您没有意义的原因是因为我们来自不同的学习路径,但没关系,我从下面的 Imran Ali 那里得到了答案。还是谢谢你。
标签: r partitioning r-caret data-partitioning