【发布时间】:2015-12-02 15:51:51
【问题描述】:
我目前正在分析一些 Apache 网络日志。一些行包含重复项(不是完全重复项,因为日期时间可能相隔几秒钟。)如下图所示。我主要在 Spark 中使用 SQL。我只想保留一个。
【问题讨论】:
-
我的解决方案有效吗?
标签: sql logging apache-spark duplicates
我目前正在分析一些 Apache 网络日志。一些行包含重复项(不是完全重复项,因为日期时间可能相隔几秒钟。)如下图所示。我主要在 Spark 中使用 SQL。我只想保留一个。
【问题讨论】:
标签: sql logging apache-spark duplicates
您可以使用“dropDuplicates”方法来删除重复项,而不是查询中的分组。
'weblogs_filter_bekijk = sqlContext.sql("select endpoint from basetable5 where ip_address = '91.74.184.68'").dropDuplicates'
这应该对您有所帮助。您可以参考下面的链接了解此方法的详细说明。
https://spark.apache.org/docs/1.5.1/api/java/org/apache/spark/sql/DataFrame.html
【讨论】:
您可以在 SQL 查询中使用group by 命令,例如:
select * from table where x = y group by x_column
【讨论】: