【问题标题】:xml.etree.ElementTree and unicode findtextxml.etree.ElementTree 和 unicode findtext
【发布时间】:2011-12-21 04:58:18
【问题描述】:

我正在尝试使用 xml.etree.ElementTree 模块中的 iterparse 解析 Medline xml 文档。除了某些文本包含非 ascii 字符外,一切都运行良好。我没有看到使用 findtext 处理 unicode 的方法。有什么建议吗?

【问题讨论】:

    标签: python xml unicode elementtree


    【解决方案1】:

    你试过用utf8编码flah打开文件吗:

    fd = open('some.xml', mode='r', encoding='utf-8')
    xml.etree.ElementTree.iterparse(fd)
    

    或者使用解码:

    fd = open('some.xml', mode='r')
    sio = StringIO(fd.read().decode("utf-8"))
    xml.etree.ElementTree.iterparse(sio)
    

    【讨论】:

    • 我认为这应该可行,但我仍然遇到错误。下一步是验证编码确实是 UTF-8
    【解决方案2】:

    除了上面的答案之外,这是一篇非常有用的帖子。

    Reading utf-8 characters from a gzip file in python

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-09-22
      • 2016-09-07
      • 1970-01-01
      • 1970-01-01
      • 2013-11-03
      • 1970-01-01
      相关资源
      最近更新 更多