【发布时间】:2017-05-08 22:37:03
【问题描述】:
我目前正在开发一个 Spark 应用程序,该应用程序使用数据帧来计算和聚合配置单元表中的特定列。
除了在dataframes/rdd 中使用count() 函数。是否有更优化的方法来获取处理的记录数或数据帧的记录数?
我只需要知道是否需要重写某个特定函数。
任何答复将不胜感激。我目前使用的是 Apache spark 1.6。
谢谢。
【问题讨论】:
-
使用内置函数是最佳方法。你不是在使用 dataframe.count() 函数吗?如果不能,您可以使用示例代码更新您的问题吗?
-
对于数据框,您可以使用
select count(*),但我不明白您为什么要这样做。
标签: scala hadoop apache-spark dataframe