【问题标题】:How to present data for repeated Title [duplicate]如何呈现重复标题的数据[重复]
【发布时间】:2019-09-01 09:09:37
【问题描述】:

示例文件Imdb sample

在电影数据集中,我有相同的标题:“明星诞生”又名“Narodziny gwiazdy” - 4 次,“万圣节” - 3 次。这些是不同年份上映的不同电影。 如何仅过滤这些多次出现的标题并显示它们的详细信息?

(titleDetails <- imdb_movies.csv %>%
  group_by(Title) %>%
  summarise(count = n()) %>%
  filter(count > 2))

titleDetails 

上面的代码将只显示标题和计数。

如何显示我在数据集中拥有的所有详细信息?

【问题讨论】:

  • 原始数据框中的一个小样本会有所帮助。
  • 已更新。对不起。我的错。
  • 请在问题中以文本形式发布数据,而不是链接。 Details
  • imdb_sample %&gt;% group_by(Title) %&gt;% filter(n() &gt; 2)

标签: r filter dplyr


【解决方案1】:

您可以拨打df[duplicated(df$Title) | duplicated(df$Title, fromLast = T), ]

duplicated(df$Title) 为具有重复标题的所有行返回一个带有TRUEs 的逻辑向量。重复标题的第一次将显示为FALSE

duplicated(df$Title, fromLast = TRUE) 做同样的事情,只是顺序相反。这一次,从您提供的数据的角度来看,重复标题的最后次出现标记为FALSE

然后,您可以通过在这两个duplicated() 调用上使用|(或)运算符获取具有重复标题的所有行的所有,并使用生成的逻辑向量索引您的原始数据。

【讨论】:

    猜你喜欢
    • 2015-07-07
    • 2012-12-02
    • 2011-02-15
    • 2011-03-20
    • 1970-01-01
    • 2018-01-20
    • 1970-01-01
    • 2011-01-13
    • 2013-04-21
    相关资源
    最近更新 更多