【问题标题】:How to do effective logging in Spark application如何在 Spark 应用程序中进行有效的日志记录
【发布时间】:2019-09-03 07:40:03
【问题描述】:

我有一个用 Scala 编写的 Spark 应用程序代码,它运行一系列 Spark-SQL 语句。这些结果是通过在最后针对最终数据帧调用操作“计数”来计算的。我想知道从 Spark-scala 应用程序作业中进行日志记录的最佳方法是什么?由于最终使用单个操作计算所有数据帧(大约 20 个),因此在记录某些语句的输出/序列/成功时,我有哪些选择。

问题本质上很少通用。由于 spark 用于惰性评估,因此执行计划由 spark 决定,我想知道应用程序语句成功运行到什么时候以及那个阶段的中间结果是什么。

这里的目的是监控长时间运行的任务,看看它在什么时候运行良好以及问题出现在哪里。

如果我们尝试在转换之前/之后进行日志记录,那么它会在读取代码时打印出来。因此,必须在实际执行期间使用自定义消息进行日志记录(在 scala 代码末尾调用操作)。如果我尝试将 count/take/first 等放在代码之间,那么作业的执行速度会减慢很多。

【问题讨论】:

标签: scala apache-spark apache-spark-sql


【解决方案1】:

我了解您所面临的问题。让我为此提出一个简单的解决方案。

您需要使用org.apache.log4j.Logger。使用以下代码行生成记录器消息。

org.apache.log4j.Logger logger = org.apache.log4j.Logger.getRootLogger();

logger.error(errorMessage);
logger.info(infoMessage);
logger.debug(debugMessage);

现在,为了将这些消息重定向到日志文件,您需要创建一个包含以下内容的 log4j 属性文件。

# Root logger option

# Set everything to be logged to the console
log4j.rootCategory=INFO, console
log4j.appender.console=org.apache.log4j.ConsoleAppender
log4j.appender.console.target=System.err
log4j.appender.console.layout=org.apache.log4j.PatternLayout
log4j.appender.console.layout.ConversionPattern=%d{yy/MM/dd HH:mm:ss} %p %c{1}: %m%n

# Settings to quiet third party logs that are too verbose
log4j.logger.org.eclipse.jetty=OFF
log4j.logger.org.eclipse.jetty.util.component.AbstractLifeCycle=OFF
log4j.logger.org.spark-project.jetty.servlet.ServletHandler=OFF
log4j.logger.org.spark-project.jetty.server=OFF
log4j.logger.org.spark-project.jetty=OFF
log4j.category.org.spark_project.jetty=OFF
log4j.logger.Remoting=OFF
log4j.logger.org.apache.spark.repl.SparkIMain$exprTyper=INFO
log4j.logger.org.apache.spark.repl.SparkILoop$SparkILoopInterpreter=INFO
log4j.logger.org.apache.parquet=ERROR
log4j.logger.parquet=ERROR

# Setting properties to have logger logs in local file system 
log4j.appender.rolling=org.apache.log4j.RollingFileAppender
log4j.appender.rolling.encoding=UTF-8
log4j.appender.rolling.layout=org.apache.log4j.PatternLayout
log4j.appender.rolling.layout.conversionPattern=[%d] %p %m (%c)%n
log4j.appender.rolling.maxBackupIndex=5
log4j.appender.rolling.maxFileSize=50MB
log4j.logger.org.apache.spark=OFF
log4j.logger.org.spark-project=OFF
log4j.logger.org.apache.hadoop=OFF
log4j.logger.io.netty=OFF
log4j.logger.org.apache.zookeeper=OFF
log4j.rootLogger=INFO, rolling
log4j.appender.rolling.file=/tmp/logs/application.log

您可以在最后一条语句中命名日志文件。确保每个节点的文件夹具有适当的权限。

现在,我们需要在提交 spark 作业的同时传递配置,如下所示。

 --conf spark.executor.extraJavaOptions=-Dlog4j.configuration=spark-log4j.properties --conf spark.driver.extraJavaOptions=-Dlog4j.configuration=spark-log4j.properties 

还有,

--files "location of spark-log4j.properties file"

希望这会有所帮助!

【讨论】:

    【解决方案2】:

    你可以使用来自 maven 的 log4j 库

    <dependency>
    <groupId>org.apache.logging.log4j</groupId>
    <artifactId>log4j-api</artifactId>
    <version>${log4j.version}</version>
    </dependency>
    

    对于日志记录,首先您需要创建一个记录器对象,然后您可以在不同的日志级别(如信息、错误、警告)进行日志记录。下面是使用 log4j 在 spark scala 中记录信息的示例:

    import org.apache.logging.log4j.LogManager
    val logger = LogManager.getLogger(this.getClass.getName)
    
    logger.info("logging message")
    

    因此,要在某些点添加信息,您可以在该点使用 logger.info("logging message")。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-09-23
      • 2011-07-11
      • 2012-06-17
      • 2015-09-02
      • 1970-01-01
      • 2012-08-04
      相关资源
      最近更新 更多