【发布时间】:2015-07-18 16:09:46
【问题描述】:
我有一个很长的列表,其中包含很多重复项,例如 100,000 个值,其中 20% 是重复项。我想从这个列表中随机抽样,将所有值分组,比如 400 个。但是,我不希望任何后续组在其中包含重复值 - 即,我希望每个组的所有 250 个成员都是唯一的。
我尝试过使用 vegan、picante、EcoSimR 的各种排列方法,但它们并没有完全达到我想要的效果,或者似乎难以处理大量数据。
我想知道是否有一些我不知道的示例函数的使用方法?任何帮助或替代建议将不胜感激......
【问题讨论】:
-
您是否需要样本在组之间是唯一的(即我对 250 条记录进行采样,然后再对 250 条记录进行采样,依此类推 - 但对于所有样本中的所有组,只显示给定的记录一次)?
-
unique函数浮现在脑海中...... -
即使您希望每个值只出现一次,您是否希望被采样的概率与它在原始数据中出现的次数成正比?如果是这样,您可以创建一个仅包含唯一值的向量,但使用
sample函数的prob参数设置与每个值在原始列表中出现的次数成比例的采样概率。 -
不,我很高兴样本可以在组之间复制,而不是在组内复制。
-
理想情况下,我希望将所有 100,000 个值同时定义到一个组(400 个组,每组 125 个)。因此,每个组将有 125 个唯一样本,但样本可以在组之间重复。
标签: r permutation random-sample