【发布时间】:2021-07-29 01:39:13
【问题描述】:
我的项目使用 JAXB 从各种来源解析 XML。这适用于大多数来源,但我无法解析来自特定来源的文档。我能找到的唯一区别是违规文档报告其编码为 UTF-16,而据我所知,其他文档似乎是 UTF-8。
代码如下:
InputStream inputStream = new FileInputStream(inputFile);
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
dbf.setNamespaceAware(true);
DocumentBuilder db = dbf.newDocumentBuilder();
Document doc = db.parse(inputStream);
这会引发以下异常:
[Fatal Error] :1:40: Content is not allowed in prolog.
org.xml.sax.SAXParseException; lineNumber: 1; columnNumber: 40; Content is not allowed in prolog.
at com.sun.org.apache.xerces.internal.parsers.DOMParser.parse(DOMParser.java:257)
at com.sun.org.apache.xerces.internal.jaxp.DocumentBuilderImpl.parse(DocumentBuilderImpl.java:339)
at javax.xml.parsers.DocumentBuilder.parse(DocumentBuilder.java:121)
at ... (my code)
违规文档以
开头<?xml version="1.0" encoding="UTF-16"?>
直接跟在根元素的开始标签之后。我用十六进制编辑器检查了文件;在开始标记之前没有其他字符(甚至没有 BOM 或任何非打印字符)。
如果我将encoding 属性更改为UTF-8,代码会运行超过该点(尽管它会进一步抛出一个不相关的异常)。
JAXB 是否与 UTF-16 不兼容?或者还有什么问题?
【问题讨论】: