【发布时间】:2018-09-06 12:35:23
【问题描述】:
我正在从 hive 表中提取数据并创建一个数据框。然后进行求和和计数操作。数据大小约为 3 TB。
例子
val DF1=hiveContext.sql("""SELECT col1,col2,col3,col4,count(col5) AS col5,
sum(col6) AS col6 from (
SELECT col1, col2, col3, col4, col5,
sum(col6) AS col6 from <Dataframe from select fields from Table>
group by col1, col2, col3, col4, col5
)
group by col1,col2,col3,col4
""")
DF1.count
这需要很多时间。您能否建议针对这种情况的最佳方法?
【问题讨论】:
-
您的 spark-UI 日志将有助于调试
标签: apache-spark hadoop dataframe apache-spark-sql spark-dataframe