【发布时间】:2020-11-13 17:10:06
【问题描述】:
我需要从https://app.cpcbccr.com/AQI_India/ 的表中获取并存储 PM2.5 和 PM10 值。我使用 BeautifulSoup4 来抓取网页,但我得到的解析后的 HTML 与实际页面不同。例如,我得到了这个
而不是这个。
我编写了获取表格行和表格数据等所需的代码,但是由于我解析的 HTML 缺少表格正文的行,它找不到它们,所以现在我只有这个来查看我解析的 HTML :
from bs4 import BeautifulSoup
import requests
import pandas as pd
url = "https://app.cpcbccr.com/AQI_India/"
soup = BeautifulSoup(requests.get(url).text, 'html.parser')
with open("Desktop/soup.html", "a") as dumpfile:
dumpfile.write(str(soup))
我怎样才能得到所有的桌子?提前致谢。
【问题讨论】:
标签: python-3.x web-scraping beautifulsoup html-parsing