【发布时间】:2017-03-25 21:41:33
【问题描述】:
我正在编写一个简单的脚本来检查网站是否存在于谷歌上,首先搜索确定的关键字。
现在,这是解析 url 并返回主机名的函数:
def parse_url(url):
url = urlparse(url)
hostname = url.netloc
return hostname
并从以下选择的标签列表开始:
linkElems = soup.select('.r a') #in google first page the resulting urls have class r
这是我写的:
for link in linkElems:
l = link.get("href")[7:]
url = parse_url(l)
if "www.example.com" == url:
#do stuff (ex store in a list, etc)
在最后一个,在第二行,我必须从第七个索引开始,因为所有 href 值都以'/url?q=' 开头。
我正在学习 python,所以我想知道是否有更好的方法来做到这一点,或者只是一种替代方法(可能使用正则表达式或替换方法或来自 urlparse 库)
【问题讨论】: