【问题标题】:How do I Regex website URLs for apache nutch?如何为 apache nutch 正则表达式网站 URL?
【发布时间】:2020-02-25 23:17:47
【问题描述】:

我正在尝试设置 apache nutch 以使用 Regex 仅抓取具有指定域的网站。我在 Regex 方面没有太多经验,而且我在弄清楚如何在 Regex 中处理我的域时遇到了麻烦。 域是 https://www.health.gov.au/ 我希望任何具有此域的网页,然后是正则表达式接受的任何其他网页。 感谢您的宝贵时间

编辑 例如,我希望 https://www.health.gov.au/health-topics 被正则表达式接受

【问题讨论】:

  • 似乎有什么问题?
  • 我不知道允许使用 url 中的域的任何网页的语法。例如我希望https://www.health.gov.au/health-topics 被允许

标签: regex url nutch


【解决方案1】:

您可以使用(https://www.health.gov.au/.*)

这将匹配https://www.health.gov.au/之后的所有字符

RegexDemo

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-07-11
    • 1970-01-01
    • 1970-01-01
    • 2014-09-15
    相关资源
    最近更新 更多