【发布时间】:2013-08-26 19:00:55
【问题描述】:
我正在使用 beautifulSoup4 开发网页抓取工具。我想获取文章的文字和图片,但是有一些问题! html代码是这样的:
<div>
some texts1
<br />
<img src="imgpic.jpg" />
<br />
some texts2
</div>
我得到了整个文本:
post_soup.get_text()
并像往常一样将所有图像保存在div 和urllib2
最后我将它们保存在一个html页面中,最后将所有文本和图像放在顶部,但我想将它们保存在新的html页面中,就像我抓取它们的页面一样,我的意思是首先some texts1然后image然后@987654327 @
有什么建议吗?
【问题讨论】:
标签: python-2.7 web-scraping beautifulsoup