【发布时间】:2019-02-18 21:39:12
【问题描述】:
我从账单的 pdf 中提取了文本,看起来像这样(账单可能不同)
___________________________________________________ |发票编号 |项目 ID |项目名称 |数量 |金额 | |___________|________|_____________|_______|________| |12323133 | 1 |惠普笔记本电脑 | 1 | 180000| |1234534H | 1 |惠普笔记本电脑 | 1 | 180000| |SW323133 | 1 |惠普笔记本电脑 | 1 | 180000| |FGF323133 | 1 |惠普笔记本电脑 | 1 | 180000| |___________|________|_____________|_______|________|现在,我需要一种算法来查找所有相关信息,例如发票编号/项目名称等。文本可以短于或超过 2-3 页
【问题讨论】:
-
文本是否有任何格式,例如 CSV 或类似格式?你能给我们举个例子吗?到目前为止,您在 java 中尝试过什么?
-
你的源文件是pdf吗?
-
是的,这是使用pdftools从pdf/image中提取的文本。
-
提取后是什么格式或数据结构?任何
List<String>行或Map<Integer, String>行及其编号? -
我建议您在使用 pdftools 提取数据时将此数据转换为 jsonobject。在 jsonobject 中获取数据后,您将对数据有更多的控制权。否则,由于不需要的间距或其他一些特殊字符,以文本格式处理这些数据将非常关键
标签: java nlp text-processing