【问题标题】:How to extract sentences matching 2 words in HTML document that may not have a period如何提取与 HTML 文档中可能没有句点的 2 个单词匹配的句子
【发布时间】:2018-11-29 15:27:56
【问题描述】:

我这里有多个 URL,我需要用单词提取句子:live(变体)和work。 (以几乎有效的公式和理想结果为例——我遇到了第 4、5 和 6 行的问题) https://docs.google.com/spreadsheets/d/1dLJfaFA_-XuVlPmS0VN0d8IR4nkUsXpCxpUwZvgLXx4/edit#gid=0

我能够使用正则表达式提取大部分但不是全部, 这是我的正则表达式匹配公式:

[^.>""]*[Ll]iv(e |es|e,|ing).* work.*(?=(<|\.|!|&))

我可以使用这个匹配公式:

>.*[Ll]iv(e |es|e,|ing).* work.*<

但是,它会截断句子,与其他html文档不匹配。

希望获得适用于所有网址的匹配公式。我已经为此工作了几天,但找不到解决方案。提前致谢!

【问题讨论】:

    标签: javascript regex google-apps-script google-sheets


    【解决方案1】:

    找到公式: (>|"")[^<>""]*[Ll]iv(e |es|e,|ing).* work.*(?=(<|\.|!|&))

    然后从那里过滤掉不需要的字符

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-09-02
      • 2014-11-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多