【发布时间】:2017-05-10 09:52:36
【问题描述】:
我想从 PDF 文件中提取数字。我想创建一个直方图来描述获得大学批准的学生的分数;这些分数存储在 PDF 文件中。有哪些方法可以提取它们?
【问题讨论】:
标签: python pdf extract python-3.4
我想从 PDF 文件中提取数字。我想创建一个直方图来描述获得大学批准的学生的分数;这些分数存储在 PDF 文件中。有哪些方法可以提取它们?
【问题讨论】:
标签: python pdf extract python-3.4
您首先需要一个 PDF 解析器,因为默认情况下 Python 无法读取它。此处发布的 SO 答案 Python module for converting PDF to text 建议使用 PDFMINER - http://www.unixuser.org/~euske/python/pdfminer/index.html
但是,您没有提供任何数字表示方式的示例。您需要使用 regex/patterns 制作某种自定义行解析器来定义如何提取这些数字的规则。难点主要看PDF是否只包含原始的统计数据,如果不是,还需要注意不要全部取入,也就是那些实际上没有引用任何统计数据,只是一个句子的数字。
你可以从这里https://docs.python.org/3/library/re.html了解更多关于python中的正则表达式
如果您对正则表达式不熟悉,您可以在这里学习和试验它 http://regexr.com/.
【讨论】: