【发布时间】:2012-12-26 12:15:15
【问题描述】:
我知道在所有情况下我都需要逃避这些:
quot "
amp &
apos '
lt <
gt >
但是有口音的国际字符,或者俄罗斯字符来命名一对呢?当我的编码指令设置为 UTF-8 时,是否需要转义这种类型的字符?
如果我将编码指令设置为 ASCII 会怎样?我还需要转义所有这些字符吗?
这是我尝试使用 Nokogiri(lib2xml) 重现的 XML 示例(来自遗留系统):
<?xml version="1.0" encoding="UTF-8"?>
<DESCRIPTION lang="rus">
<SHORT_DESCRIPTION>МОДУЛЬ- ELECTRONIC OUTPUT 120 V DC 5 mA</SHORT_DESCRIPTION>
<LONG_DESCRIPTION>МОДУЛЬ- ТИП ELECTRONIC OUTPUT ВХОД 120 V DC ВЫХОД 5 mA ИСТОЧНИК ПИТАНИЯ 120 V DC ДОПОЛНИТЕЛЬНАЯ ДЕТАЛЬ 1 ANALOG SM322-8S TOR</LONG_DESCRIPTION>
</DESCRIPTION>
您可以看到示例中的指令说 UTF-8,但它们已经转义了很多字符,Nokogiri 只有在我指定 ASCII 编码指令时才会转义的字符。这让我很困惑。
编辑 2:如果我不向 Nokogiri 传递编码指令,则生成的 XML 会将所有俄语字符保留在其原生西里尔字母中,但这与我需要复制的 XML 不一致。
【问题讨论】:
-
不,你没有。但请确保您实际上将文件编码为 UTF-8... 仅具有属性
encoding="UTF-8"并不能做到这一点。 -
Esailija 提出了一个很好的观点。这里有两件事 - 声明的编码,它告诉解析器文档编码,以及用于将字符数据写入编码八位字节的编码。它们必须匹配,否则解析器使用错误的解析器并在读取数据时破坏数据。
-
我在我需要复制的 xml 文件中添加了一个示例,它在说明中说明了编码 UTF-8,但转义了不应转义的字符,因为它们是有效的 UTF-8。
-
更新后的样本仍然可能是合法的 UTF-8,但这可能是一个 hack,因为在某些时候开发其中一个系统(生产者、消费者或中间层)的人没有'无法真正理解 UTF-8,或者必须使用自认为可以但没有使用的技术。
-
听起来我有两个选择,告诉 xml builder UTF-8 并相信它会转义所有非 UTF-8 字符并强制不符合要求的消费系统更改,或者破解我的输出匹配旧版本,转义所有非 ascii 字符。如果我选择前者,我可能会有一场战斗。
标签: ruby xml encoding xml-parsing nokogiri