【发布时间】:2014-09-24 21:12:47
【问题描述】:
我想用 tika 提取一个 xml 文件的完整内容。这意味着 tika 不应将文本从元素中取出并丢弃标签。
内容的输出应该是这样的:
content:
<?xml version="1.0" encoding="UTF-8" ?>
<xml>
<tag1>text</tag1>
<tag2>text</tag2>
</xml>
但结果总是这样:
content:
text
text
程序代码:
public static void main(String[] args) {
try {
InputStream input;
input = new FileInputStream(new File("D:/SolrTestFileSystem/Test_Files/test.xml"));
ContentHandler textHandler = new WriteOutContentHandler();
Metadata metadata = new Metadata();
XMLParser parser = new XMLParser();
ParseContext context = new ParseContext();
parser.parse(input, textHandler, metadata, context);
input.close();
System.out.println("content: " + textHandler.toString());
} catch (Exception e) {
// TODO Auto-generated catch block
e.printStackTrace();
}
}
xml文件:
<?xml version="1.0" encoding="UTF-8" ?>
<xml>
<tag1>text</tag1>
<tag2>text</tag2>
</xml>
【问题讨论】:
标签: xml apache apache-tika