【发布时间】:2019-02-25 02:09:45
【问题描述】:
我想制作一系列包含此 PDF (http://mica.lif.univ-mrs.fr/d6.clean2-backup.pdf) 中树木的文件。文件的名称将是左侧对应的树编号(t0、t1 等)。
我曾尝试使用 python 来提取相关信息和树,但我遇到了麻烦。具体来说,当我尝试将树木提取为图像时(使用https://nedbatchelder.com/blog/200712/extracting_jpgs_from_pdfs.html),没有任何树木出现(可能是因为树木的格式不正确)。但是,当我尝试将其全部提取为文本(如https://www.geeksforgeeks.org/working-with-pdf-files-in-python/)时,树会丢失所有格式(我认为还有一些信息)。我怎样才能从这个 PDF 中获取我想要的文件?可以用 Python 完成吗?还有其他更简单的方法吗?
或者,我从中获得 PDF 的网站 (http://mica.lif.univ-mrs.fr/) 具有另一种形式的树(例如:t27 S##1#l# NP#0#2#l#s NP#0#2# r#s VP##3#l# V##4#l#h V##4#r#h NP#1#5#l#s NP#1#5#r#s VP##3#r #S##1#r#)。有没有什么好的方法可以将这种形式转换成树木形式的良好视觉效果?
任何一种方法(或其他方法,如果人们有想法)的任何帮助将不胜感激。谢谢!
【问题讨论】:
-
也许您可能想展示您当前的一些代码,以便有人可以更好地帮助您找到解决方案。
标签: python pdf tree nlp extraction