【问题标题】:for loop to determine the top 10 percent of values in an intervalfor 循环确定区间中前 10% 的值
【发布时间】:2022-01-10 21:36:12
【问题描述】:

我基本上在 data.frame 中有两列(向量),速度和加速度是这样的:

    speed     acceleration
1   3.2694444 2.6539535522
2   3.3388889 2.5096979141
3   3.3888889 2.2722134590
4   3.4388889 1.9815256596
5   3.5000000 1.6777544022
6   3.5555556 1.3933215141
7   3.6055556 1.1439051628
8   3.6527778 0.9334115982
9   3.6722222 0.7561602592

我需要找到 x 轴(速度)上的每个值速度,y 轴(加速度)的前 10% 最大值是多少。这也需要在特定的时间间隔内。例如速度 3.2-3.4、3.4-3.6 等。你能告诉我在这种情况下 for 循环会是什么样子吗?

【问题讨论】:

  • 每组没有足够的行数以使其在样本数据中有意义,并且在不首先进行分箱的情况下按看起来像连续变量的内容进行分组可能是个坏主意。通过四舍五入进行一些分箱,可能是library(dplyr); df %>% group_by(speed_binned = round(speed, 1)) %>% summarise(p90 = quantile(acceleration, p = 0.9), p100 = max(acceleration))
  • 或者speed_binned = cut(speed, seq(3, 4, .2))

标签: r for-loop max intervals


【解决方案1】:

正如@alistaire 已经指出的那样,您提供的数据量非常有限。所以我们首先要模拟更多的数据,我们可以根据这些数据来测试我们的代码。

set.seed(1)

# your data
speed <- c(3.2694444, 3.3388889, 3.3388889, 3.4388889, 3.5,
           3.5555556, 3.6055556, 3.6527778, 3.6722222)
acceleration <- c(2.6539535522, 2.5096979141, 2.2722134590,
                  1.9815256596, 1.6777544022, 1.3933215141,
                  1.1439051628, 0.9334115982, 0.7561602592)
df <- data.frame(speed, acceleration)

# expand data.frame and add a little bit of noise to all values
# to make them 'unique'
df <- as.data.frame(do.call(
  rbind,
  replicate(15L, apply(df, 2, \(x) (x + runif(length(x), -1e-1, 1e-1) )),
            simplify = FALSE)
))

函数create_intervals,顾名思义,创建用户定义的间隔。其余代码执行“繁重的工作”并将所需结果存储在out

如果您希望speed 的间隔具有相等的宽度,只需指定您希望拥有的组数 (n_groups) 并保留其余参数(即 lwrupr , 和 interval_span) 未指定。

# Cut speed into user-defined intervals
create_intervals <- \(n_groups = NULL, lwr = NULL, upr = NULL, interval_span = NULL) {
  if (!is.null(lwr) & !is.null(upr) & !is.null(interval_span) & is.null(n_groups)) {
    speed_low <- subset(df, speed < lwr, select = speed)
    first_interval <- with(speed_low, c(min(speed), lwr))
    middle_intervals <- seq(lwr + interval_span, upr - interval_span, interval_span)
    speed_upp <- subset(df, speed > upr, select = speed)
    last_interval <- with(speed_upp, c(upr, max(speed)))
    intervals <- c(first_interval, middle_intervals, last_interval)
  } else {
    step <- with(df, c(max(speed) - min(speed))/n_groups)
    intervals <- array(0L, dim = n_groups)
    for(i in seq_len(n_groups)) {
      intervals[i] <- min(df$speed) + i * step
    }
  }
  return(intervals)
}

# three intervals with equal width
my_intervals <- create_intervals(n_groups = 3L)

# Compute values of speed when acceleration is greater then
# or equal to the 90th percentile 
out <- lapply(1:(length(my_intervals)-1L), \(i) {
  x <- subset(df, speed >= my_intervals[i] & speed <= my_intervals[i+1L])
  x[x$acceleration >= quantile(x$acceleration, 0.9), ]
})

# function to round values to two decimal places
r <- \(x) format(round(x, 2), nsmall = 2L)

# assign names to each element of out
for(i in seq_along(out)) {
  names(out)[i] <- paste0(r(my_intervals[i]), '-', r(my_intervals[i+1L]))
}

输出 1

> out
$`3.38-3.57`
       speed acceleration
11  3.394378     2.583636
21  3.383631     2.267659
57  3.434123     2.300234
83  3.394886     2.580924
101 3.395459     2.460971

$`3.57-3.76`
      speed acceleration
6  3.635234     1.447290
41 3.572868     1.618293
51 3.615017     1.420020
95 3.575412     1.763215

我们还可以根据比等间隔的速度间隔更“有意义”的间隔来计算 speed 的期望值,例如[min(speed), 3.3), [3.3, 3.45), [3.45, 3.6), 和 [3.6, max(speed))。

这可以通过不指定n_groups 来实现,而是指定lwrupr 和一个有意义的interval_span。例如,当下限为 3.3,上限为 3.6 时,区间跨度为 0.15 是有意义的。

# custom boundaries based on a lower limit and upper limit
my_intervals <- create_intervals(lwr = 3.3, upr = 3.6, interval_span = 0.15)

输出 2

> out
$`3.18-3.30`
      speed acceleration
37 3.238781     2.696456
82 3.258691     2.722076

$`3.30-3.45`
      speed acceleration
11 3.394378     2.583636
19 3.328292     2.711825
73 3.315306     2.644580
83 3.394886     2.580924

$`3.45-3.60`
      speed acceleration
4  3.520530     2.018930
40 3.517329     2.032943
58 3.485247     2.079893
67 3.458031     2.078545

$`3.60-3.76`
      speed acceleration
6  3.635234     1.447290
34 3.688131     1.218969
51 3.615017     1.420020
78 3.628465     1.348873

注意:如果您使用的是 R 版本,请使用 function(x) 而不是 \(x)

【讨论】:

  • !太棒了!!!正是我需要的:)它完美地工作。我的实际数据集包含 > 20 000 个观察结果,因此在我的情况下无需扩展数据(但很高兴知道未来)。也谢谢你,alistaire
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-08-30
  • 2021-05-12
  • 2012-12-12
  • 2015-02-25
  • 1970-01-01
  • 2022-12-17
相关资源
最近更新 更多