【发布时间】:2012-08-02 23:35:44
【问题描述】:
我正在处理很多 .xml 文件。 (百万 - 维基百科的 .xml 格式转储),它们比我想象的更难以阅读。
目前,我编写了一个 .css 文件以在浏览器中以可读的方式显示它们,并编写了一个脚本来将此 .css 的引用插入到所有文件中。
(我知道还有其他解决方案,例如 XSLT - 但我发现的所有信息使它看起来不适合文档级别 - 如果可能,我真的尽量不扩大这些文件的大小)
.css 适用于 一些 文件,但许多包含像   这样的实体,我收到如下错误:
"XML Parsing Error: undefined entity" 带有一个漂亮的小插图,指向   或者它在引用中的亲属。
有一个articles.dtd 文件,它似乎应该连接浏览器的点(关键字-> Unicode)。它在每个文件中都被引用,例如:
<!DOCTYPE article SYSTEM "../article.dtd">
并包含很多条目,例如:
<!ENTITY nbsp " "> <!-- no-break space = non-breaking space,
U+00A0 ISOnum -->
但是要么我完全误解了这个文件的用途,要么它不能正常工作。
无论如何;我怎样才能让这些文件显示出来;通过:
- 显示实体(如“&nbSp”作为纯文本)
- 完全删除实体(通过任何方式,除了在实际文件中线性搜索/删除它们)
- 按照预期将实体解释为 unicode
当然,后者更可取;绝对理想的是,通过引用某种将身份映射到 Unicode 的外部文件(如果这不是articles.dtd 文件的用途......)
编辑:我在这里没有使用功能强大的机器.. 提取 .rars 需要几天时间。对每个文件进行任何形式的编辑都需要很长时间。
【问题讨论】:
-
除了所有其他类似的问题,这个问题是在 2 小时前提出的 stackoverflow.com/questions/11341862/how-to-avoid-in-xml
-
好的,谢谢。我发现了这个问题,等等;但它的解决方案适用于我的情况,仅提供了一种替代方案,可以替代我线性搜索/删除实体的最后选择。我觉得我的问题的背景不同,足以证明它自己的问题。