【发布时间】:2015-10-30 02:49:17
【问题描述】:
我正在使用 beautifulsoup 从网站构建数据。我需要先从sitemap.xml 网站获取所有.gz 文件。
我做到了:
def getGz():
http = httplib2.Http()
status, response = http.request('url/sitemap.xml)
soup = BeautifulSoup(response)
links = soup.find_all("loc")
然后我有所有.gz 文件的网址,但外面有<loc>。我怎样才能摆脱<loc>?
我现在拥有的:
<loc>url/sitemap-samples-0.xml.gz</loc>
我想去掉<loc>,然后打开.gz文件。
而且,我如何从互联网上打开 .gz 文件并使用 python 获取其中的信息?
【问题讨论】:
-
在每个链接上添加
.get_text()应该去掉<loc>标签。 -
请将您的问题标题更改为更具描述性和相关性。
标签: python xml beautifulsoup gzip