【问题标题】:Hive Regex not working蜂巢正则表达式不起作用
【发布时间】:2015-09-29 19:32:01
【问题描述】:

我正在尝试使用 org.apache.hadoop.hive.serde2.RegexSerDe 创建一个配置单元外部表,用于分析一些 Log4J 日志。

但是,我的regexhttp://www.regexr.com/ 中进行测试时即使正常也无法正常工作。

我的问题是当我有多行日志时,例如,带有相应 StackTrace 的异常日志。

这是一个例子:

@@@@ 2015-09-29T11:20:45,549 INFO MYHOSTNAME my-app org.hibernate.jpa.internal.util.LogHelper HHH000204: Processing PersistenceUnitInfo [
    name: name
    ...] @@@@

我在日志的开头和结尾添加了一个模式,以帮助在多行时提取它。

这是我的正则表达式:

@@@@ (.{23}) ([\\w]+) ([\\w]+) ([\\w\\-]+) ([\\w\\.$]+) ([\\s\\S]+) @@@@

这是我的桌子:

CREATE EXTERNAL TABLE log4j(
    dt STRING,
    level STRING,
    host STRING,
    app_name STRING,
    clazz STRING,
    message STRING)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.RegexSerDe'
WITH SERDEPROPERTIES ("input.regex" = "@@@@ (.{23}) ([\\w]+) ([\\w]+) ([\\w\\-]+) ([\\w\\.$]+) ([\\s\\S]+) @@@@")
STORED AS TEXTFILE
LOCATION 'hdfs://localhost:9000/logs/';

使用单行日志可以正常工作,但是对于示例中的多行日志,它会提取多行且所有列都为空。

【问题讨论】:

  • 您可以尝试在正则表达式的开头添加(?s) 吗?喜欢这里regex101.com/r/qF0rD1/1
  • 没用,出现同样的问题。

标签: regex hadoop hive


【解决方案1】:

如果你使用:

STORED AS TEXTFILE

然后 Hadoop 将首先按行分解输入(\r\n\r\n),然后第二将每个输入行馈送到 RegexSerDe。这就是您无法使用TEXTFILE 将多行输入转换为单行输出的原因。相反,请尝试使用:

STORED AS INPUTFORMAT 'org.apache.hadoop.mapred.TextInputFormat'

并将 Hadoop 配置属性 textinputformat.record.delimiter 设置为在您的输入中分隔两条记录的任何字符串。对于您的数据,一个示例分隔符可能是@@@@\n@@@@@@@@\r\n@@@@。请记住,设置此分隔符会从数据中删除匹配的文本,因此您处理的记录中不会包含 @@@@

在更改任何配置文件之前测试它的一种方法是在运行查询之前在 Hive shell 会话中设置它:

set textinputformat.record.delimiter=@@@@\n@@@@

【讨论】:

    猜你喜欢
    • 2018-12-21
    • 1970-01-01
    • 2019-02-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多