【发布时间】:2017-03-25 17:42:19
【问题描述】:
我写了一个 scraper 来scraper 从网站上删除数据,但不幸的是网站上的数据不一致。有时该段落是使用<p> 标签编写的,有时不是。 (下面给出的代码片段)
有什么动态的方法知道吗?
产生错误的部分代码
main_content = soup.findAll("div", {"class": "story-detail"})
content = ""
for div in main_content:
links = div.findAll('p')
for a in links:
a = str(a).strip('<p>')
a = str(a).strip('/>')
a = str(a).strip('<')
a = str(a).strip('<br>')
content = content + a
【问题讨论】:
标签: python web-scraping beautifulsoup web-crawler