【发布时间】:2021-11-06 00:13:10
【问题描述】:
我有兴趣从一些看起来像this 的 PDF 文件中提取一些信息。我只需要第 2 页的信息,之后如下所示:
- (U) 国家:在 [日期] [文本]。 (括号中的文字)
这意味着它总是以一个国家的点号开头,并以括号结束,括号也可以转到下一行。
我在python中的实现如下:
- 使用pdfminer extract_text函数获取全文。
- 然后在整个文本中使用 re.findall 函数,使用这个正则表达式
^\d{1,2}\. \(u\) \w+.\w*.\w*:.* on \d{1,2} \w+.*$和 re.MULTILINE 选项。
我注意到这会提取我感兴趣的所有段落的第一行,但我无法找到一种方法来抓取所有内容,直到括号 (.*) 的段落结尾。
我想知道是否有人可以为此提供一些帮助。我希望我只能通过一个正则表达式来匹配它。否则我可能会尝试逐行拆分并遍历每一个。
提前致谢。
【问题讨论】: