【发布时间】:2012-08-02 22:31:59
【问题描述】:
我正在制作一个脚本,它从 bash 中的谷歌页面获取所有链接。我使用w3m 实用程序和这个脚本获得了谷歌页面:
#!/bin/bash
# performs a google search using a word in input
word=$1
touch .google
if [ -z $word ]
then
echo "$word missing!"
echo "Aborting..."
exit
fi
a="www.google.com/search?q="
search=$a$word
w3m -no-cookie $search > .google
sleep 1
接下来,我必须从此页面获取所有站点。我正在考虑采用所有以www. 开头并以/ 结尾的字符串
echo `grep -wo "www[^/]*" .google`> .temp
这样做的问题是我错过了很多不以www 开头的链接,同时当有一个不以/ 结尾的站点时,我冒着破坏一切的风险。
有什么更好的方法可以从此响应中获取网址?
【问题讨论】: