【发布时间】:2016-01-13 04:00:46
【问题描述】:
关于使用 BeautifulSoup,我仍有一些不明白的地方。我可以用它来解析网页的原始 HTML,这里是“example_website.com”:
from bs4 import BeautifulSoup # load BeautifulSoup class
import requests
r = requests.get("http://example_website.com")
data = r.text
soup = BeautifulSoup(data)
# soup.find_all('a') grabs all elements with <a> tag for hyperlinks
然后,要检索和打印所有具有 'href' 属性的元素,我们可以使用 for 循环:
for link in soup.find_all('a'):
print(link.get('href'))
我不明白的是:我有一个包含多个网页的网站,每个网页都列出了几个超链接,这些超链接指向一个带有表格数据的网页。
我可以使用 BeautifulSoup 来解析主页,但是如何使用相同的 Python 脚本来抓取第 2 页、第 3 页等呢?您如何“访问”通过“href”链接找到的内容?
有没有办法编写一个 python 脚本来做到这一点?我应该使用蜘蛛吗?
【问题讨论】:
标签: python html parsing web-scraping beautifulsoup