【问题标题】:How can I count runs in a sequence?如何按顺序计算运行次数?
【发布时间】:2010-12-02 22:34:09
【问题描述】:

在 R 中,计算序列中相同元素的运行次数最有效/最简单的方法是什么?

例如,如何计算非负整数序列中连续零的个数:

x <- c(1,0,0,0,1,0,0,0,0,0,2,0,0) # should give 3,5,2

【问题讨论】:

  • 您想要 R 中的答案吗?如果是这样,最好以“In R ...”作为问题的开头,而不是仅仅使用 R 标签。
  • 注意:这不适用于 NA 或 NaN 的运行(它们总是被视为不连续的)。一个丑陋的 hack 解决方法是将 NA 和 NaN 分配给一些标记整数值。

标签: r count


【解决方案1】:

使用rle():

y <- rle(c(1,0,0,0,1,0,0,0,0,0,2,0,0))
y$lengths[y$values==0]

【讨论】:

  • 您将如何根据这些数据绘制直方图?想象一下,我有从 1 到 100 的数字,以及不同长度的序列。我想创建一个直方图,显示某个长度的运行发生的频率或数字发生的频率或两者兼而有之。
  • 这里不是新问题的地方。
【解决方案2】:

这可以通过使用值更改位置的索引以有效的方式完成:

x <- c(1,0,0,0,1,2,1,0,0,1,1)

查找值变化的地方:

diffs <- x[-1L] != x[-length(x)]

获取索引,然后在后续索引中获取差异:

idx <- c(which(diffs), length(x))
diff(c(0, idx))

【讨论】:

  • 这就是 rle() 所做的。
  • 对不起,抢。之前在我的 iPhone 上写过,没有“应用程序”。 :)。请投票给 Rob 的答案,而不是我的!
  • +1:虽然rle() 是回答 OP 问题的更简单方法,但在某些情况下,此解决方案还有其他优势。特别是,我一直在寻找一种方法来对每次运行进行唯一编号而不是对运行进行计数,我发现我可以使用 c(0,cumsum(x[-1L] != x[-length(x)])) 来做到这一点。
  • 谢谢Shane,非常有帮助:)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-04-26
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多