【发布时间】:2011-05-13 09:26:22
【问题描述】:
我有一堆 XML 文件以及 DTD,每个文件都有一个 <TEXT> 部分。 TEXT 元素的 DTD 如下所示:
<!ELEMENT TEXT - - (AGENCY* | ACTION* | SUMMARY* | DATE* | FOOTNAME* | FURTHER* | SIGNER* | SIGNJOB* | FRFILING* | BILLING* | FOOTNOTE* | FOOTCITE* | TABLE* | ADDRESS* | IMPORT* | #PCDATA)+ >
这是一个示例 XML 文件的样子:
<ROOT>
...
<TEXT>
Some text that I want to extract
<SUMMARY> Some more text </SUMMARY>
<AGENCY>
An agency
<SIGNER> Bob Smith </SIGNER>
</AGENCY>
</TEXT>
...
</ROOT>
最后,我要提取
我想提取的一些文本 还有一些文字 一个机构 鲍勃·史密斯
但是,每个<TEXT> 块显然在元素/排序方面或您走多远方面都不相同。在 Java 中有没有使用 DOM 的方法可以做到这一点?我更喜欢使用 DOM 而不是 SAX,但如果使用 SAX 更容易,那就这样吧。
提前致谢
【问题讨论】:
标签: java xml xml-parsing