【发布时间】:2019-10-19 12:33:11
【问题描述】:
我在 Reddit 上有一组帖子和 cmets 的数据行和列,其中一行代表一个帖子,它是评论。由于一篇帖子可能包含多个 cmets,因此我有具有相同 ID(帖子 ID)和不同评论 ID 的行。我想将具有相同 id 的行合并为一行,并在列中包含所有不同的评论 id - 'comment id' 用逗号分隔。而且由于帖子数据(标题、正文等)是重复的(如附图所示),我不需要将它们合并为每行仅出现一次。
![重复行][1] 1
我可以合并以逗号分隔的相关列的评论信息,但我不知道如何获得不需要合并的重复帖子信息的一次出现。
all_reddits <- all_posts_and_comments %>%
group_by(id) %>%
summarise(
comment_id = paste(comment_id, collapse=","),
comment_author = paste(comment_author, collapse = ","),
comment_body = paste(comment_body, collapse = ","),
comment_score = paste(comment_score, collapse = ","),
comment_created_date = paste(comment_created_date, collapse = ","),
comment_link = paste(comment_link, collapse=",")
)
我已经尝试过 R: dplyr 的 summarise_all() 和 summarise_at() ,但我不断收到错误。
【问题讨论】: