【发布时间】:2016-11-30 09:48:56
【问题描述】:
我有一个网址:
http://www.goudengids.be/qn/business/advanced/where/Provincie%20Antwerpen/what/restaurant
在该页面上有一个“下一个结果”按钮,它加载另外 20 个数据点,同时仍显示第一个数据集,而不更新 URL。我编写了一个脚本来在 python 中抓取这个页面,但它只抓取前 22 个数据点,即使单击“下一个结果”按钮并显示大约 40 个数据。
如何抓取这些动态加载内容的网站
我的脚本是
import csv
import requests
from bs4 import BeautifulSoup
url = "http://www.goudengids.be/qn/business/advanced/where/Provincie%20Antwerpen/what/restaurant/"
r = requests.get(url)
r.content
soup = BeautifulSoup(r.content)
print (soup.prettify())
g_data2 = soup.find_all("a", {"class": "heading"})
for item in g_data2:
try:
name = item.text
print name
except IndexError:
name = ''
print "No Name found!"
【问题讨论】:
标签: python csv web-scraping beautifulsoup