【发布时间】:2018-03-13 21:29:44
【问题描述】:
我将如何使用 Python 下载网页,以便我可以离线查看它们并筛选他们的 html 代码以获取信息?
就像在任何网页上右键单击并单击 Save-As。
【问题讨论】:
-
结帐beautifulsoup
-
@UmangGupta 我做到了,你会怎么做?我看到很多关于如何获取部分网站但不是全部内容的示例。谢谢。
我将如何使用 Python 下载网页,以便我可以离线查看它们并筛选他们的 html 代码以获取信息?
就像在任何网页上右键单击并单击 Save-As。
【问题讨论】:
你一定要看看Requests和Beautiful Soup。
简单的例子是这样的(注意:你必须先使用 pip python -m pip install <library> 安装这两个库):
import requests
from bs4 import BeatifulSoup
res = requests.get('www.example.com')
soup = BeautifulSoup(res.text, 'html.parser')
print(soup.prettify())
最后一行将打印出网站的整个 html,但它也会将其格式化为可读形式,就像您通过检查网站上的元素查看 html 时一样。
如果您想下载页面并将其放在单独的 html 文件中,您可以这样做:
with open('example.html', 'w', encoding = 'utf8') as webSite:
webSite.write(soup.prettify())
webSite.close()
【讨论】: