【问题标题】:Why is node's backtracking regex faster than RE2 in this example为什么在这个例子中节点的回溯正则表达式比 RE2 快
【发布时间】:2017-08-17 23:32:41
【问题描述】:

我需要接受用户的正则表达式——我知道这很疯狂。 Google RE2 正则表达式解析器比基于 PCRE 的解析器更安全,因为它不使用回溯,从而防止灾难性回溯、无限循环和一般混乱。据称它通常更快。在我的测试用例中,它只解析一个系统日志行,它的速度超过了 300%。任何想法为什么?

我在 Ubuntu 上使用 Node v7.7.3。

有问题的代码:

const SYSLOG_LINE_REGEX = new RegExp([
    /(<[0-9]+>)?/, // 1 - optional priority
    /([a-z]{3})\s+/, // 2 - month
    /([0-9]{1,2})\s+/, // 3 - date
    /([0-9]{2}):/, // 4 - hours
    /([0-9]{2}):/, // 5 - minutes
    /([0-9]{2})/, // 6 - seconds
    /(\s+[\w.-]+)?\s+/, // 7 - host
    /([\w\-().0-9/]+)/, // 8 - process
    /(?:\[([a-z0-9-.]+)\])?:/, // 9 - optional pid
    /(.+)/ // 10  message
].map(regex => regex.source).join(''), 'i');
const parts = SYSLOG_LINE_REGEX.exec(log.trim());

更新

  • 使用节点模块 re2@1.4.1
  • 使用 2016 年 11 月 30 日包含在 node-re2 包中的 re2 C++ 代码。
  • 我安装了 libre2-dev 软件包版本 20160501+dfsg-1。也许我应该更新 node-re2 下的源代码,或者让它简单地链接到系统库。

【问题讨论】:

    标签: node.js regex re2


    【解决方案1】:

    RE2 具有线性最坏情况复杂性。 Node.js 的 Irregexp 引擎具有指数级最坏情况复杂性。

    但是!引擎的最坏情况行为不仅是正则表达式的函数,也是被测试输入的函数。正则表达式 /(a+)+$/ 在 Node.js 中是最坏情况下的指数,但如果你将它与除 aaaaaaaaaa...a 之外的任何东西进行匹配,它将运行得非常快。正则表达式的平均情况匹配时间不同于其最坏情况的复杂性。 Node.js 引擎开发人员可能优化了平均情况复杂度而不是最坏情况复杂度。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-11-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多