【发布时间】:2018-03-22 01:02:51
【问题描述】:
我正在从一个 bash shell 脚本运行 wget,它是这样的:
input=$1
#iterate input text file line by line and run following on each line:
wget -a links.log -nv --spider line_n_url
问题是输出有很多 404 错误,甚至确实存在的 url 的格式如下:
2017-10-10 11:35:46 URL: http://someurl.com/somefile.ext 200 OK
有没有办法格式化 wget 写入的输出或轻松 sed 对其进行排序?
另一个问题是 .ext 是三种可能的类型,这使得匹配更加困难..
我所追求的是每个现有的 URL 在其自己的行中没有时间戳,URL: 或 200 OK
http://someurl.com/somefile.ext
http://someurl.com/somefile2.ex2
http://someurl.com/somefile3.exp
谢谢。
【问题讨论】:
标签: shell awk sed scripting wget