【问题标题】:Unmarshalling XML with JAXB without unescaping characters使用 JAXB 解组 XML 而不转义字符
【发布时间】:2012-02-15 15:46:22
【问题描述】:

想象以下情况:我们从某个外部工具接收到一个 xml 文件。最近在这个 xml 中,节点名或它们的richcontent 标记中可能有一些转义字符,如以下示例(简化):

<map>
<node TEXT="Project">
<node TEXT="&#xe4;&#xe4;">
<richcontent TYPE="NOTE"><html>
  <head>

  </head>
  <body>
    <p>
      I am a Note for Node &#228;&#228;!
    </p>
  </body>
</html>
</richcontent>
</node>
</node>
</map>

在使用 JAXB 解组文件后,那些转义的字符不会转义。不幸的是,我需要他们保持原样,意思是逃跑了。有什么方法可以避免在解组时取消转义这些字符?

在研究时,我发现了很多关于编组 xml 文件的问题,但这些问题也对我没有帮助:

是否有可能通过 JAXB 实现这一目标,或者我们是否必须考虑更改为不同的 xml 阅读器 API?

提前谢谢你, 梅内

【问题讨论】:

  • 对于任何 xml 解析器来说,源文档是否包含 ä、'ä` 或 &amp;#xe4 都无关紧要,为什么这对你来说很重要?
  • 问题是:在导入这些 XML 数据后,我们将其与我们的程序数据合并。在那里我们更改了一些细节,然后想将这些细节写回外部工具的 xml 中。由于我们不会仅仅为了将数据编组回 xml 中而构建另一个对象图,因此我们决定使用 StAX,因为此时这更简单。从那时起,直到现在我们还没有任何转义字符,不幸的是,外部工具希望这些字符仍然可以工作。

标签: java xml escaping unmarshalling


【解决方案1】:

您只需将&amp;amp;# 替换为&amp;amp;# 即可调用

unmarshaller.unmarshal(new AmpersandingStream(new FileInputStream(...)));

import java.io.IOException;
import java.io.InputStream;

/**
* Replaces numerical entities with their notation as text.
*/
public class AmpersandingStream extends InputStream {

    private InputStream in;
    private boolean justReadAmpersand;
    private String lookAhead = "";

    public AmpersandingStream(InputStream in) {
        this.in = in;
    }

    @Override
    public int read() throws IOException {
        if (!lookAhead.isEmpty()) {
            int c = lookAhead.codePointAt(0);
            lookAhead = lookAhead.substring(Character.charCount(c));
            return c;
        }
        int c = in.read();
        if (c == (int)'#' && justReadAmpersand) {
            c = (int)'a';
            lookAhead = "mp;#";
        }
        justReadAmpersand = c == (int)'&';
        return c;
    }

    @Override
    public int available() throws IOException {
        return in.available();
    }

    @Override
    public void close() throws IOException {
        in.close();
    }

    @Override
    public synchronized void mark(int readlimit) {
        in.mark(readlimit);
    }

    @Override
    public boolean markSupported() {
        return in.markSupported();
    }

    @Override
    public int read(byte[] b) throws IOException {
        return in.read(b);
    }

    @Override
    public int read(byte[] b, int off, int len) throws IOException {
        return in.read(b, off, len);
    }

    @Override
    public synchronized void reset() throws IOException {
        in.reset();
    }

    @Override
    public long skip(long n) throws IOException {
        return in.skip(n);
    }

}

【讨论】:

  • 注意:在这种方法会破坏 XML 的情况下,构建一个文档相对容易(例如,编码为 UTF-16;在 CDATA 部分中放置与号等)
  • 这里有一个测试用例:&lt;x&gt;&lt;![CDATA[&amp;]]&gt;&lt;/x&gt;.
  • 代码查找序列&amp;amp;#。在 CDATA 中可能有问题,但是 JAXB 和 CDATA?在其他地方&amp; 总是有意义的。
  • @McDowell 你对 UTF-16 的看法是对的,但我认为这不太可能。
猜你喜欢
  • 2014-11-21
  • 1970-01-01
  • 2015-03-25
  • 2013-01-17
  • 1970-01-01
  • 2016-02-05
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多