【发布时间】:2020-08-21 16:49:00
【问题描述】:
我有一个包含客户代码、客户姓名和邮政编码的数据集。数据集有 149130 行。我想将它平均分成两个数据集(每个数据集 74565 行)并导出到 excel 中。但是我想确保如果一个邮政编码有两个客户 - 一个去dataset1,另一个去dataset2。其余的可以是随机选择的客户。我是 r 新手,尝试过各种训练/测试和示例代码 - 但是我无法达到所需的结果。
总结一下 - 我正在尝试从数据框中创建 2 个随机样本,但想确保如果某个邮政编码下的客户超过 2 个 - 他们应该在两个样本之间平均分配。
样本数据 -
【问题讨论】:
-
请提供您的数据样本,例如
dput(head(my_data)). -
附上@markhogue 图片。 TIA
-
@NKHH,用户无法从图像中复制数据。请将输出粘贴到问题块中。
-
我在回答中做了一些可以通过的虚假数据
标签: r random dplyr tidyverse purrr