【发布时间】:2011-12-21 04:58:18
【问题描述】:
我正在尝试使用 xml.etree.ElementTree 模块中的 iterparse 解析 Medline xml 文档。除了某些文本包含非 ascii 字符外,一切都运行良好。我没有看到使用 findtext 处理 unicode 的方法。有什么建议吗?
【问题讨论】:
标签: python xml unicode elementtree
我正在尝试使用 xml.etree.ElementTree 模块中的 iterparse 解析 Medline xml 文档。除了某些文本包含非 ascii 字符外,一切都运行良好。我没有看到使用 findtext 处理 unicode 的方法。有什么建议吗?
【问题讨论】:
标签: python xml unicode elementtree
你试过用utf8编码flah打开文件吗:
fd = open('some.xml', mode='r', encoding='utf-8')
xml.etree.ElementTree.iterparse(fd)
或者使用解码:
fd = open('some.xml', mode='r')
sio = StringIO(fd.read().decode("utf-8"))
xml.etree.ElementTree.iterparse(sio)
【讨论】:
除了上面的答案之外,这是一篇非常有用的帖子。
【讨论】: