【发布时间】:2012-10-18 15:37:56
【问题描述】:
我正在尝试从 URL 的 XML 文件中的特定字段获取信息。在我开始尝试之前,我就遇到了这些奇怪的错误。这是我的代码:
url1 = 'http://www.dac.unicamp.br/sistemas/horarios/grad/G5A0/indiceP.htm'
data1 = urllib.urlopen(url1)
xml1 = minidom.parse(data1)
我收到此错误:
File "C:\Users\Administrator\Desktop\teste.py", line 15, in <module>
xml1 = minidom.parse(data1)
File "C:\Python27\lib\xml\dom\minidom.py", line 1920, in parse
return expatbuilder.parse(file)
File "C:\Python27\lib\xml\dom\expatbuilder.py", line 928, in parse
result = builder.parseFile(file)
File "C:\Python27\lib\xml\dom\expatbuilder.py", line 207, in parseFile
parser.Parse(buffer, 0)
ExpatError: not well-formed (invalid token): line 4, column 22
我做错了吗?我从教程中复制了这些功能,它似乎应该可以工作..
【问题讨论】:
-
页面好像不是xhtml有效的,试试beautifulsoup吧。
-
@luke14free 哦,那是一回事吗?因此,如果页面对 XML 解析无效,还有其他方法可以获得我想要的信息吗?如果您进入页面,您会在右上角看到“Verão/2012”,这就是我要查找的字段。
-
试试这个:validator.w3.org 只需将 url 粘贴到地址输入字段中
标签: python xml url xml-parsing python-2.7