【发布时间】:2020-11-16 08:40:19
【问题描述】:
我有以下类型的数据集(第一行是标题):
-
content总是文本 -
merge总是合乎逻辑的
id1 id2 start_line end_line content merge
A B 1 1 "aaaa" TRUE
A B 4 4 "aa mm" TRUE
A B 5 5 "boool" TRUE
A B 6 6 "omw" TRUE
C D 6 6 "hear!" TRUE
C D 7 7 " me out!" TRUE
C D 21 21 "hello" FALSE
问题:我需要按照非常具体的标准进行合并:
- 具有
merge = FALSE的行必须保持原样 - 具有相同
id1、相同id2和连续start_line的行:- 需要在列上追加
content -
end_line值需要更改到最后一行
- 需要在列上追加
所以,预期的结果是:
id1 id2 start_line end_line content merge
A B 1 1 "aaaa" TRUE
A B 4 6 "aa mm boool omw" TRUE
C D 6 7 "hear! me out!" TRUE
C D 21 21 "hello" FALSE
在示例中注意:
- 最小合并是两行(id 示例:C-D,最初是第 6 行和第 7 行)
- 可以合并多行(ID A-B 的示例,最初是第 2、3、4 行)
我尝试了一系列非常大且效率低下的循环,只合并了两行。这就是为什么我不在这里发布我的尝试。
【问题讨论】:
标签: r dataframe merge reshape string-concatenation