【发布时间】:2017-09-30 06:08:59
【问题描述】:
我们正在使用 scrapy 并希望获取位于特定 div 中的文章正文。所以我们写了这个:
article['body'] = response.xpath('string(//div[@itemprop="articleBody"])').extract_first()
问题是有时我们会收到不需要的文本。 例如,我们从 div 中的样式标签中获取此文本: "#container_14931537823{\n\t\tpadding:5px 5px 0px 10px;"
我们可以用beautifulsoup 解析文章,但我们会得到相同的结果:
article['body'] = ''.join(soup.find_all('div',attrs={"itemprop" : "articleBody"})[0].text)
我们获取所有文本正文所在的 div,然后应用一种方法(字符串或文本)来提取和连接我们的文本,但是否可以排除此 div 中不需要的标签? 我们是否强制编写一个函数来清除提取的文本?
【问题讨论】:
-
网站网址是什么?
-
我正在查看物品加载器的工作原理,很快就会反馈。
-
很难理解项目加载器上下文,如果有人有好的链接或教程:)
标签: python beautifulsoup scrapy