【问题标题】:The fastest way to get count of processed dataframe records in Spark在 Spark 中获取已处理数据帧记录数的最快方法
【发布时间】:2017-05-08 22:37:03
【问题描述】:

我目前正在开发一个 Spark 应用程序,该应用程序使用数据帧来计算和聚合配置单元表中的特定列。

除了在dataframes/rdd 中使用count() 函数。是否有更优化的方法来获取处理的记录数或数据帧的记录数?

我只需要知道是否需要重写某个特定函数。

任何答复将不胜感激。我目前使用的是 Apache spark 1.6。

谢谢。

【问题讨论】:

  • 使用内置函数是最佳方法。你不是在使用 dataframe.count() 函数吗?如果不能,您可以使用示例代码更新您的问题吗?
  • 对于数据框,您可以使用select count(*),但我不明白您为什么要这样做。

标签: scala hadoop apache-spark dataframe


【解决方案1】:

除了在 dataframes/rdd 中使用 count() 函数,还有没有更优化的 获取处理的记录数或记录数的方法 一个数据框?

不。由于一个 RDD 可能有一个任意复杂的执行计划,包括 JDBC 表查询、文件扫描等,所以没有先验的方法来确定它的大小而不能计数。

【讨论】:

    猜你喜欢
    • 2011-04-07
    • 1970-01-01
    • 2014-12-06
    • 1970-01-01
    • 2011-10-06
    • 2017-01-24
    • 2012-12-08
    • 1970-01-01
    • 2017-08-24
    相关资源
    最近更新 更多