【发布时间】:2010-11-04 03:45:19
【问题描述】:
我想解析html中的表格,但是我发现lxml无法解析?怎么了?
# -*- coding: utf8 -*-
import urllib
import lxml.etree
keyword = 'lxml+tutorial'
url = 'http://www.baidu.com/s?wd='
if __name__ == '__main__':
page = 0
link = url + keyword + '&pn=' + str(page)
f = urllib.urlopen(link)
content = f.read()
f.close()
tree = lxml.etree.HTML(content)
query_link = '//table'
info_link = tree.xpath(query_link)
print info_link
打印结果只是 []...
【问题讨论】:
-
这并不能真正回答 lxml 的问题,但如果您在解析网页时遇到问题,您可能想看看 Beautiful Soup:crummy.com/software/BeautifulSoup
标签: python parsing lxml web-crawler