【发布时间】:2014-10-05 20:23:42
【问题描述】:
我刚刚制作了一个 python 脚本,该脚本可以访问律师的个人资料以获取他们的详细信息。它适用于第一页,但循环不会转到第二页。该脚本仅从第一页抓取数据。我想刮掉所有页面。请帮助我,我是 python 新手。
代码如下:
import requests
from lxml import html
root_url = 'http://lawyerlist.com.au/'
def get_page_urls():
for no in ('1','2'):
page = requests.get('http://lawyerlist.com.au/lawyers.aspx?city=Sydney&Page=' + no)
tree = html.fromstring(page.text)
return (tree.xpath('//td/a/@href'))
for li in (get_page_urls()):
pag=requests.get(root_url + li)
doc = html.fromstring(pag.text)
for name in doc.xpath('//tr/td/h1/text()'):
print(name)
【问题讨论】: