【问题标题】:Downloading Website in Python用 Python 下载网站
【发布时间】:2018-03-13 21:29:44
【问题描述】:

我将如何使用 Python 下载网页,以便我可以离线查看它们并筛选他们的 html 代码以获取信息?

就像在任何网页上右键单击并单击 Save-As

【问题讨论】:

  • 结帐beautifulsoup
  • @UmangGupta 我做到了,你会怎么做?我看到很多关于如何获取部分网站但不是全部内容的示例。谢谢。

标签: python html


【解决方案1】:

你一定要看看RequestsBeautiful Soup

简单的例子是这样的(注意:你必须先使用 pip python -m pip install <library> 安装这两个库):

import requests
from bs4 import BeatifulSoup

res = requests.get('www.example.com')
soup = BeautifulSoup(res.text, 'html.parser')


print(soup.prettify())

最后一行将打印出网站的整个 html,但它也会将其格式化为可读形式,就像您通过检查网站上的元素查看 html 时一样。

如果您想下载页面并将其放在单独的 html 文件中,您可以这样做:

with open('example.html', 'w', encoding = 'utf8') as webSite:
    webSite.write(soup.prettify())

webSite.close()

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-12-31
    • 1970-01-01
    • 1970-01-01
    • 2019-05-09
    • 2023-03-14
    • 1970-01-01
    • 1970-01-01
    • 2016-03-31
    相关资源
    最近更新 更多