【发布时间】:2023-03-04 13:50:01
【问题描述】:
在 Python Scrapy 爬虫的实现中,我想添加一个强大的机制来监视/检测网站内潜在的布局变化。
这些更改必然影响现有的蜘蛛选择器 - 例如,一个网站添加了一个新的 HTML 元素来表示一个项目收到的访问者数量 - 我现在可能有兴趣解析一个元素. 话虽如此,检测选择器问题(Xpath/CSS)在它们被删除/重新定位的情况下也是有益的。
请注意,这与选择器内容更改或网站刷新(if-modified-since 或 last-modified)无关,而是对网站结构/节点/布局的修改。
因此,如何实现逻辑来监控这种情况?
【问题讨论】:
标签: python web-scraping scrapy web-crawler health-monitoring