【发布时间】:2011-05-02 23:01:53
【问题描述】:
我正在使用 lxml.html 来解析一些 hmtl 以获取链接,但是当它点击包含图像的链接时,它只会返回空白,它真正想要的是能够检测它是否是图像,并且然后尝试返回图像替代文本。
所以它看起来像这样......
from lxml.html import parse, fromstring
doc = fromstring('<a href="Link One">Anchor Link One</a><br /><a href="Link Two"<img src="Image Link Two" alt="Alt Image" /></a><br /><a href="Link Three">Anchor Link Three</a><br />')
for link in doc.cssselect('a'):
print '%s: %s' % (link.text_content(), link.get('href'))
结果
Anchor Link One: Link One
: Link Two
Anchor Link Three: Link Three
所以我尝试使用 .html_content() 来尝试获取原始 html,然后检查它是否是图像。
嗯..如何检测是否包含在图像中,和/或在那里提取 html....
【问题讨论】:
标签: python html-parsing lxml