【问题标题】:Removing invalid characters from XML before serializing it with XMLSerializer()在使用 XMLSerializer() 序列化之前从 XML 中删除无效字符
【发布时间】:2013-02-02 18:54:12
【问题描述】:

我正在尝试将用户输入存储在客户端 (javascript) 上的 XML 文档中,并将其传输到服务器以保持持久性。

例如,一个用户粘贴了包含 STX 字符 (0x2) 的文本。 XMLSerializer 没有转义 STX 字符,因此没有序列化为格式良好的 XML。或者,也许 .attr() 调用应该转义了 STX 字符,但在任何一种情况下,都生成了无效的 XML。

我发现浏览器内 XMLSerializer() 的输出并不总是格式正确,(甚至不满足浏览器自己的 DOMParser()

这个例子表明 STX 字符没有被 XMLSerializer() 正确编码:

> doc = $.parseXML('<?xml version="1.0" encoding="utf-8" ?>\n<elem></elem>');
    #document
> $(doc).find("elem").attr("someattr", String.fromCharCode(0x2));
    [ <elem someattr=​"">​</elem>​ ]
> serializedDoc = new XMLSerializer().serializeToString(doc);
    "<?xml version="1.0" encoding="utf-8"?><elem someattr=""/></elem>"
> $.parseXML(serializedDoc);
    Error: Invalid XML: <?xml version="1.0" encoding="utf-8"?><elem someattr=""/></elem>

我应该如何在浏览器中构造一个 XML 文档(参数由任意用户输入确定),以便它始终是格式正确的(所有内容都正确转义)?我不需要支持 IE8 或 IE7。

(是的,我确实在服务器端验证了 XML,但是如果浏览器将一个格式不正确的文档交给服务器,那么服务器能做的最好的就是拒绝它,这对可怜的用户)

【问题讨论】:

  • 我不确定有什么比逐个字符地遍历源字符串、根据需要转换为实体更容易的事情。
  • 我不相信自己能做到这一点(我什至对 XML 了解得不够好,无法寻找其他可能的问题)...... (inString) ?
  • 另外,你会不会意外地双重实体化?例如,如果在将来的浏览器中 XMLSerializer()+attr() 最终实体化,您最终会双重转义吗?
  • 好吧,我并不是说绝对是 easy :-) 我猜有人可能已经做了类似的事情并提供了它,但它看起来像一种不寻常的问题;通常在浏览器中的 JavaScript 中,您的代码是 XML 的recipient,而不是来源。
  • XML 中不能有字符 0x2。它在 XML 1.0 版中是非法的。唯一允许的控制字符是\r\n,所以这是一个错误。

标签: javascript xml xmlserializer well-formed


【解决方案1】:

这里有一个函数 sanitizeStringForXML() 可以用来在赋值之前清理字符串,或者一个派生函数 removeInvalidCharacters(xmlNode) 可以传递一个 DOM 树和将自动清理属性和文本节点,以便安全存储。

var stringWithSTX = "Bad" + String.fromCharCode(2) + "News";
var xmlNode = $("<myelem/>").attr("badattr", stringWithSTX);

var serializer = new XMLSerializer();
var invalidXML = serializer.serializeToString(xmlNode);

// Now cleanse it:
removeInvalidCharacters(xmlNode);
var validXML = serializer.serializeToString(xmlNode);

我基于来自non-restricted characters section of this wikipedia article 的字符列表,但补充平面需要 5 位十六进制数字 unicode 字符,并且 Javascript 正则表达式不包含此语法,所以现在,我只是剥离它们(你不会错过太多......):

// WARNING: too painful to include supplementary planes, these characters (0x10000 and higher) 
// will be stripped by this function. See what you are missing (heiroglyphics, emoji, etc) at:
// http://en.wikipedia.org/wiki/Plane_(Unicode)#Supplementary_Multilingual_Plane
var NOT_SAFE_IN_XML_1_0 = /[^\x09\x0A\x0D\x20-\xFF\x85\xA0-\uD7FF\uE000-\uFDCF\uFDE0-\uFFFD]/gm;
function sanitizeStringForXML(theString) {
    "use strict";
    return theString.replace(NOT_SAFE_IN_XML_1_0, '');
}

function removeInvalidCharacters(node) {
    "use strict";

    if (node.attributes) {
        for (var i = 0; i < node.attributes.length; i++) {
            var attribute = node.attributes[i];
            if (attribute.nodeValue) {
                attribute.nodeValue = sanitizeStringForXML(attribute.nodeValue);
            }
        }
    }
    if (node.childNodes) {
        for (var i = 0; i < node.childNodes.length; i++) {
            var childNode = node.childNodes[i];
            if (childNode.nodeType == 1 /* ELEMENT_NODE */) {
                removeInvalidCharacters(childNode);
            } else if (childNode.nodeType == 3 /* TEXT_NODE */) {
                if (childNode.nodeValue) {
                    childNode.nodeValue = sanitizeStringForXML(childNode.nodeValue);
                }
            }
        }
    }
}

请注意,这只会从属性的 nodeValues 和 textNodes 中删除无效字符。它不检查标签名称或属性名称、cmets 等。

【讨论】:

  • 感谢对字符列表的更正,如果有错误,我不会知道:-(
  • 为什么要在正则表达式中添加多行标志m?无论哪种方式都应该匹配
【解决方案2】:

检查 https://gist.github.com/john-doherty/b9195065884cdbfd2017a4756e6409cc,

非常有用的要点,示例用法:

const resultXml = removeXMLInvalidChars(INPUT_XML_STRING, true);

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-04-26
    • 2016-04-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多