【问题标题】:Parsing data with multiple delimitters using Pig使用 Pig 解析具有多个分隔符的数据
【发布时间】:2014-09-02 01:11:45
【问题描述】:

我是猪的新手。解析这样的数据的有效方法是什么?我正在考虑在= 运算符之后选择每个字段值,例如日期、时间、devname 等。

Jun 24 05:25:01 23.45.56.222 date=2014-06-24 time=05:04:43 devname=XX-FGT-Primary 
device_id=FG3K8A3408600390 log_id=0021000002 type=traffic subtype=allowed pri=notice 
vd=XX-Internet src=23.83.57.99 src_port=7569 src_int="amc-sw1/2" dst=23.91.19.16 
dst_port=343 dst_int="amc-sw1/1" SN=116445695565 status=accept policyid=2272 
dst_country="India" src_country="India" dir_disp=org tran_disp=noop service=HTTPS 
proto=6 duration=122 sent=124 rcvd=84 sent_pkt=3 rcvd_pkt=2    

任何代码 sn-ps 都会有帮助。

【问题讨论】:

    标签: hadoop apache-pig


    【解决方案1】:

    我认为您正在寻找名为 REGEX_EXTRACT_ALL 的 UDF。

    对于代码 sn-p,请查看 here

    【讨论】:

    • 非常感谢 Mikko Kupsu
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-03-09
    • 1970-01-01
    • 1970-01-01
    • 2019-06-30
    • 1970-01-01
    • 1970-01-01
    • 2023-03-31
    相关资源
    最近更新 更多