【发布时间】:2014-04-27 13:05:39
【问题描述】:
假设我有一个包含网页链接列表的文件。
www.xyz.com/asdd
www.wer.com/asdas
www.asdas.com/asd
www.asd.com/asdas
我知道 curl www.xyz.com/asdd 会为我获取该网页的 html。我想从那个网页获取一些数据。
所以场景是使用 curl 逐个点击文件中的所有链接,并从网页中提取一些数据并存储在其他地方。任何想法或建议。
【问题讨论】:
-
你熟悉
while read line; do curl "$line"; done < your_file吗?它将遍历每一行和curl。对于其余的要求,您的意思不是很清楚。 -
use curl to hit all the links in the file你必须先解析文件。 -
@fedorqui 在点击每一行之后我想使用正则表达式提取页面的标题可能是
-
这是另一个问题。你试过什么?
-
ooo @fedorqui 您的命令为我完成了这项工作,非常感谢。添加它作为我会接受的答案