【问题标题】:How do I delete duplicate rows from these web logs如何从这些网络日志中删除重复的行
【发布时间】:2015-12-02 15:51:51
【问题描述】:

我目前正在分析一些 Apache 网络日志。一些行包含重复项(不是完全重复项,因为日期时间可能相隔几秒钟。)如下图所示。我主要在 Spark 中使用 SQL。我只想保留一个。

See Image here

【问题讨论】:

  • 我的解决方案有效吗?

标签: sql logging apache-spark duplicates


【解决方案1】:

您可以使用“dropDuplicates”方法来删除重复项,而不是查询中的分组。

'weblogs_filter_bekijk = sqlContext.sql("select endpoint from basetable5 where ip_address = '91.74.184.68'").dropDuplicates'

这应该对您有所帮助。您可以参考下面的链接了解此方法的详细说明。

https://spark.apache.org/docs/1.5.1/api/java/org/apache/spark/sql/DataFrame.html

【讨论】:

    【解决方案2】:

    您可以在 SQL 查询中使用group by 命令,例如:

    select * from table where x = y group by x_column 
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-10-24
      • 1970-01-01
      • 1970-01-01
      • 2017-01-02
      • 2012-04-12
      • 1970-01-01
      • 1970-01-01
      • 2010-12-04
      相关资源
      最近更新 更多