【发布时间】:2013-03-15 12:40:14
【问题描述】:
我只是在寻找有关 python 网络抓取的一些信息。我正在尝试从this 时间表中获取所有数据,并且我希望将课程链接到其开启时间。查看 html 有多个表(表中的表)。我打算将 Google App Engine 与 Python 一起使用(也许 BeautifulSoup 也是如此)。关于解决此问题的最佳方法有什么建议吗?
谢谢
更新:
我已经设法使用以下代码从表中提取了所需的数据:
import urllib
from lxml import etree
import StringIO
url = "http://ttcache.dcu.ie/Reporting/Individual;Locations;id;lg25?
template=location+Individual&weeks=20&days=1-5&periods=1-30&Width=0&Height=0"
result = urllib.urlopen(url)
html = result.read()
parser = etree.HTMLParser()
tree = etree.parse(StringIO.StringIO(html), parser)
xpath = "//table[2]/tr/td//text()"
filtered_html = tree.xpath(xpath)
print filtered_html
但是我得到很多这些u'\xa0', u'\xa0', '\r\n', '\r\n' 字符散布在整个解析的文本中。关于如何解决这些问题有什么建议吗?
谢谢
【问题讨论】:
-
这是一个非常简单的任务,您可以使用 lxml lib 来完成它。
-
您能详细说明一下吗?我是 lxml 的新手,所以不知道从哪里开始。谢谢
标签: python google-app-engine google-cloud-datastore web-scraping beautifulsoup