【发布时间】:2022-01-01 07:03:37
【问题描述】:
我开始使用Beautiful Soup 抓取网站内容和 HTML 代码。我想要一个 Python 代码,它可以存储当前/实时的抓取内容或 HTML 代码。然后在特定的手动分配的时间间隔之后,代码应该再次执行并抓取同一网站或网页的内容或 HTML 代码。然后它应该比较两个抓取的数据并显示发生的任何变化。我希望这段代码能够监控网站上发生的变化并报告它们。
到目前为止我做了什么:
import requests
from bs4 import BeautifulSoup
url ="https://www.uetmardan.edu.pk/uetm/"
# Step1: Get the HTML content
r = requests.get(url)
# Step2: Parse the HTML content
soup = BeautifulSoup(r.content, 'html5lib')
#print(soup.prettify()) # just printing the HTML code
print(soup.get_text()) # just printing the text
【问题讨论】:
-
听起来你很清楚自己想要什么,你的问题是什么?
-
此代码抓取数据或内容。我知道我想要什么,但问题在于实施。我想要一个可以执行我提到的上述任务的代码
-
您是否尝试过实现您想要的,是否遇到了您有疑问的特定错误或问题?
-
计时的东西很简单。
while True:/...do stuff.../time.sleep(5*60)。其余的取决于您要比较的内容。 -
您必须知道要监控哪些信息。我们对此无能为力。当然,您可以将整个页面存储到一个文件中,然后一次比较整个文本,但这可能不太有用。我假设页面上有您想要监控的内容。我们不知道。
标签: python html web-scraping beautifulsoup