【问题标题】:Do you consider the different probabilities of events when doing a random sample? (in R)在进行随机抽样时,您是否考虑了事件的不同概率? (在 R 中)
【发布时间】:2021-05-29 19:59:37
【问题描述】:

我对 R 的了解并不多,因此非常感谢任何帮助。提前致谢!

A) 我的主要问题是我是否应该考虑随机样本中事件的不同概率以及如何准确地做到这一点。

例如,在我拥有的橙子中,71% 是超级多汁的,22% 是中等多汁的,7% 是微多汁的。我从中提取了三种分布:超级多汁、中等多汁和温和多汁(基于果汁水平)。 Super juicy 的平均值为 400 和 sd 为 100。中等多汁的平均值为 300 和 sd 为 75。轻度多汁的平均值为 200 和 sd 为 60。

我想为我要用橙子制作的果汁创建一个多汁度评级。多汁性等级定义为果汁中使用的橙子的平均等级。

因为我想做一个 15 个橙子的随机样本,所以我的代码如下所示:

set.seed(4000)

samples=rnorm(15, mean=c(400,300,200), sd=c(100,75,60))

这应该会显示 15 个随机抽样的橙子及其各自的多汁度等级。 然后,要对整个果汁进行评分,我会这样做:

rating.juice=mean(samples)

评级.果汁

这是正确的吗?我不确定我是否应该考虑这样一个事实:71% 的橙子是超级多汁的,22% 是中等多汁的,7% 是温和多汁的。

【问题讨论】:

  • 你是用替换还是不用替换?
  • 无替换

标签: r


【解决方案1】:

A) 这是不正确的。这会生成 5 个超级多汁的橙子、5 个中等多汁的橙子和 5 个温和多汁的橙子。您给出的平均向量和您给出的标准差向量每 3 次抽签回收一次。为了更清楚这是做什么的,请参阅以下代码和输出。您会看到第一个和第四个元素的平均值为 400,第二个和第五个的平均值为 0,第三个和第六个的平均值为 -200。

> samples=rnorm(6, mean=c(400,0,-200), sd=c(100,75,60))
> samples
[1]  360.82620   49.81907 -254.86976  347.60612  -12.95888 -220.26652

我会在区间 0 和 1 上生成一个随机均匀,如果它在 0 和 0.71 之间,则从 super juicy 分布中提取,如果它在 0.71 和 .93 之间,则从 medium juicy 分布中提取,并且否则从温和多汁的分布中提取。

set.seed(4000)
oranges=numeric(0)
for (i in 1:15) {
  prob=runif(1)
  orange=numeric(0)
  if (prob < .71) {
    orange=rnorm(1, 400, 100)
  } else if (prob < .93) {
    orange=rnorm(1, 300, 75) 
  } else {
    orange=rnorm(1, 200, 60)
  }
  oranges[i]=orange
}
> print(mean(oranges))
[1] 330.9605

B) 这是正确的。您不会在这里考虑 71% 的超级多汁等,因为您已经预先确定了超级多汁、中等多汁和温和多汁橙子的数量。您将考虑概率的地方将在 A 部分。

C) 要找到概率,您可以使用模拟。很难找到一个封闭形式的解决方案。

juicyA=function() {
  oranges=numeric(0)
  for (i in 1:15) {
    prob=runif(1)
    orange=numeric(0)
    if (0 < prob & prob < .71) {
      orange=rnorm(1, 400, 100)
    } else if (prob < .93) {
      orange=rnorm(1, 300, 75) 
    } else {
      orange=rnorm(1, 200, 60)
    }
    oranges[i]=orange
  }
  return(mean(oranges))
}
in_range=0
for (i in 1:10000) {
  juiciness=juicyA()
  if (juiciness > 250 & juiciness < 300) {
    in_range=in_range+1
  }
}
> print(in_range/10000)
[1] 0.0148

建议 可以做类似的事情来计算从 B 部分提取的橙子的多汁性在 250 到 300 之间的概率。注意我们在这里使用概率的定义,即长期成功率。

【讨论】:

  • 10000从哪里来? (在 1:10000 中)
  • 它是任意大数。 1:10000 表示进行 10000 次迭代。原则上,数字越大,模拟概率越接近实际概率。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2018-07-11
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-09-12
  • 1970-01-01
相关资源
最近更新 更多