【问题标题】:How to ensure the selected mean of sampled data from non-normally distributed data如何确保从非正态分布的数据中选择采样数据的均值
【发布时间】:2021-08-26 07:09:51
【问题描述】:

我有 10000 个实例的数据,类似于负二项分布。我正在从这些数据中抽样,但我需要一个正态分布且具有预先指定平均值的子样本。我怎样才能做到这一点?

library(MASS)
my_trees <- rnegbin(10000, mu = 15, theta = 3)
hist(my_trees)
mean(my_trees)

my_sample <- sample(my_trees, size = 500)
hist(my_sample) 
mean(my_sample)

我怎样才能对正态分布的数据进行采样,例如25?我知道prob 参数,并且还阅读了this 相关问题,但无论如何我无法得到我想要的。

【问题讨论】:

  • 也许rnorm 是您正在寻找的。查看documentation 了解更多详情和示例。
  • 谢谢,但我不知道如何应用此功能从现有空间中采样?正如我所看到的,它只是生成正态分布的随机样本?
  • 如果我忽略了某些东西,我深表歉意,但是在 composition R 包中,有不同的 PRE-DEFINED 空间可用于生成正态分布的样本。但我看不出有任何选择可以提供自己的空间和样品。如果我错了,请纠正我。

标签: r distribution sample


【解决方案1】:

正态分布有两个参数;位置参数和尺度参数。 您只提到了均值 (25),那么您可以使用rnorm(n, mean = 25) 生成从正态分布分布的 n 个随机值。对于不同的 sd(比例参数),使用rnorm(n, mean, sd)。与生成my_treesrnegbin 的方式相同,rnorm 执行相同的工作。 https://www.stat.umn.edu/geyer/old/5101/rlook.html 提供有关其他几个发行版的信息。

【讨论】:

  • 是的,rnorm 生成一个随机样本,但我需要从现有的(负二项式)分布中抽取样本。为什么这个这么重要?我的数据实际上是一个有树木的真实森林,并且我正在尝试模拟采伐,因此采样的树木稍后将从初始 NB 分布中删除。你认为我仍然可以使用 rnorm 来完成我的任务吗?
  • @JerryTheForester 我可以询问有关“现有(负二项式)分布中的样本”的更多信息,尤其是“现有”部分。
  • 在我的问题中,您可以看到变量“my_trees”。这是我现有的空间,有树木和它们的直径。现在,我需要从“my_trees”中抽取 500 棵树,它们的平均 DBH 为 25,然后将它们从“my_trees”变量中删除。
  • @JerryTheForester 从 my_trees 数据中抽取 500 个样本,这些样本服从均值为 25 的正态分布。这样是否正确?
  • rnorm的第一个参数是作为样本量的数据数量,而不是总体数据。所以 rnorm(my_trees, mean = 25) 将不起作用。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2018-10-04
  • 2013-12-20
  • 1970-01-01
  • 1970-01-01
  • 2019-10-30
  • 1970-01-01
  • 2019-08-19
相关资源
最近更新 更多