【发布时间】:2016-07-05 17:33:55
【问题描述】:
我有一个如下的xml文件
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://ezinearticles.com/</loc>
<changefreq>hourly</changefreq>
<priority>1.0</priority>
</url>
<url>
<loc>https://ezinearticles.com/submit/</loc>
<changefreq>weekly</changefreq>
<priority>0.3</priority>
</url>
...................
我想使用 xpathin lxml 模块从所有标签中获取 URL。我按照下面的代码实现了它,但它没有用。结果是空列表
from lxml import etree
parser = etree.XMLParser(ns_clean=True)
xmlfile = "sitemap1.xml"
xmlobj = etree.parse(xmlfile, parser)
loc = xmlobj.xpath('//loc[text()]')
print(loc)
谁能帮我修复我的脚本?
【问题讨论】:
-
...当然,这个问题与 XHTML 无关,但它是完全相同的问题(只是有两个不同的命名空间)。
标签: python xml xpath xml-parsing lxml