【发布时间】:2018-01-23 12:49:39
【问题描述】:
我尝试使用 PDFTextStripperByArea 和 PDPageContentStream 类从我的 pdf 文件中提取数值。 他们工作得很好!
但我的要求是使用 PDFTable 或 PDFTableExtractor 类来阅读 pdf 内容。你能告诉我访问上述类需要使用的 maven 依赖项 和 jar 文件 是什么吗? 还要提到从特定位置获取值所需的方法。
我还有一个疑问。 我们可以从PDF文件中提取表格格式的数据吗?我的意思是带有行和带有表格行的列的数据。如果一个页面包含一些文本和一个表格,我们可以只读取表格标题和行吗? 我已将我的页面上传到 GitHub。点击here!从该图像中,我只需要毛保费、GST 和应付总额的值。请告诉我是否可能
【问题讨论】:
-
我使用 Apache PDFBox(一个免费库)进行 PDF 操作。想知道它对你有多重要。
-
Apache PDFBox 包含 PDPageContentStream 并且 我已经尝试过了。效果很好!。但是在这里,我需要使用 PDFTableExtractor 来实现我的要求。
-
这两个类
PDFTable和PDFTableExtractor是否与pdfbox相关? -
没有。它们不属于 PDFBox
-
您在评论中写道,您被指示尝试
PDFTableExtractor。在这种情况下,我会说你不应该为学习 maven 和选择 jdk 而烦恼,而是专注于让它以某种方式运行,看看它是否解决了请求。所以最简单的方法是在你的 IDE 中创建一个非 maven 项目并附加 jar 文件。顺便说一句,有一个提取表的工具:tabula java。不知道有没有API。
标签: java pdf maven-2 maven-plugin pdfbox