【问题标题】:Learning to use perl like regular expressions in PIG Latin.学习在 PIG Latin 中使用 perl 之类的正则表达式。
【发布时间】:2014-05-23 04:35:56
【问题描述】:

有没有办法从 Pig Latin 中的文件中提取某些单词,例如:我想要一个带有推文的大文件中的所有单词,开头有一个 #。

Input :  What a lovely day! #Sunshine
Output : Sunshine

【问题讨论】:

    标签: hadoop apache-pig latin


    【解决方案1】:

    看看 REGEX_EXTRACT:http://pig.apache.org/docs/r0.12.1/func.html#regex-extract

    这应该可以工作(从 your_field 中提取前面带有 # 的最后一个单词):

    REGEX_EXTRACT(your_field, '.*#(\\w+)($|\\s.*)', 1)
    

    【讨论】:

      【解决方案2】:

      好的,使用 FILTER 对我有用:startswithHash = filter by 匹配 '#.*' ;

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2010-09-05
        • 1970-01-01
        • 2016-03-07
        • 2022-11-28
        • 2018-07-05
        • 2013-02-17
        相关资源
        最近更新 更多