【发布时间】:2014-08-14 16:54:08
【问题描述】:
我正在努力从网页中提取主要内容,而不是在 python 中删除任何类似图像的内容,但大多数库只是将文本本身或已清理的 dom 元素返回给我。
我需要 dom 元素本身包含文章的主要内容,包括图片。
有没有为此目的的图书馆?
谢谢
【问题讨论】:
标签: python dom web-scraping web-crawler extraction
我正在努力从网页中提取主要内容,而不是在 python 中删除任何类似图像的内容,但大多数库只是将文本本身或已清理的 dom 元素返回给我。
我需要 dom 元素本身包含文章的主要内容,包括图片。
有没有为此目的的图书馆?
谢谢
【问题讨论】:
标签: python dom web-scraping web-crawler extraction
如果您的意思是使用 img src="" 获取整个 dom 节点,那么我相信 beautifulsoup4 可以做到。
http://www.crummy.com/software/BeautifulSoup/bs4/doc/
但对于实际图像,我不知道您必须单独请求图像。
或者您可以使用 selenium https://pypi.python.org/pypi/selenium,它将使用您的浏览器(Firefox、Chrome),因此可以做任何事情来提取网页内容
【讨论】: