【发布时间】:2014-05-22 21:32:49
【问题描述】:
我正在处理从 PDF 导出的非结构化文本数据。原始数据来自转换为文本格式的 PDF 中的表格,因此剩下的就是它的一般结构。我正在查看的特定部分曾经是一个表格。
例如,这里有一些示例输入
A B C D E
1 2 3
4 6 7
第一行表示标题,后面几行是值。
幸运的是,保留了间距(有点):每列之间总是至少有两个空格。但是,实际的空格数会有所不同,具体取决于解析器根据表的结构决定如何处理它。
我想将这些行解析为以下数组。我将首先解析标题以获取列,然后在解析其余行时将其用作我需要的模板。
{"A", "B", "C", "D", "E"}
{"1", "2", "", "", "3"}
{"4", "", "6", "7", ""}
仅给出这些信息,是否可以准确地做到这一点?
【问题讨论】:
-
要获取标题,您可以使用
split("\\s+")。但是你怎么知道第二行是{"1", "2", "", "", "3"}而不是{"1", "", "2", "", "3"} -
是的。但你需要展示你的努力才能在这里得到更多的东西..
-
@GirlyGirl 基于空格数和(大部分)原始数据。
标签: java pdf split string-parsing