【发布时间】:2021-11-04 08:41:07
【问题描述】:
我有一个蜘蛛,它会从给定的 url(s) 中抓取联系方式。
工作正常,但它收集的一些数据来自页面上的 css 规则,例如某些 <svg></svg> 属性可能显示为有效数字。或者<scripts></script> 中的某些图像映射(例如404_static_desk_1920-w375@1x.jpg)可能会显示为有效的电子邮件地址。
如何让scrapy忽略某些标签并完全忽略html属性?
【问题讨论】:
标签: python scrapy web-crawler