【发布时间】:2014-07-18 08:23:04
【问题描述】:
我想在 www.site.com/en/ 下下载所有可访问的 html 文件。但是,网站上有很多带有帖子参数的链接 URL(例如每个产品类别的第 1、2、3.. 页)。我希望 wget 不要下载这些链接。我正在使用
-R "*\?*"
但它并不完美,因为它只是在下载后删除文件。
有什么方法可以过滤 wget 后面的链接吗?
【问题讨论】:
我想在 www.site.com/en/ 下下载所有可访问的 html 文件。但是,网站上有很多带有帖子参数的链接 URL(例如每个产品类别的第 1、2、3.. 页)。我希望 wget 不要下载这些链接。我正在使用
-R "*\?*"
但它并不完美,因为它只是在下载后删除文件。
有什么方法可以过滤 wget 后面的链接吗?
【问题讨论】:
可以避免使用正则表达式的文件,您必须使用 --reject-regex '(.*)\?(.*)' 但它仅适用于 wget 版本 1.15,因此我建议您先检查您的 wget 版本。
【讨论】: