【问题标题】:pdfquery not returning values in BBOXpdfquery 不返回 BBOX 中的值
【发布时间】:2017-12-23 16:03:40
【问题描述】:

我正在尝试使用 pdfquery 库在 pdf 的所需 bbox 中返回文本。

import pdfquery

pdf = pdfquery.PDFQuery("C:/Users/tyler.cowan/Desktop/PDF Miner/test.pdf")

test =  pdf.extract([
      ('UWI/API', 'LTTextLineHorizontal:in_bbox("35.28,700.56,127.44,717.84")'),
 ])

print(test)

我首先从返回的页面的左上角定义了bbox

{'UWI/API': [<LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>, <LTTextLineHorizontal>]}

然后我继续从页面的左下角定义 bbox 并返回类似的内容。然后我继续定义一个包含整个 8.5" x 11" 页面的 bbox,并返回更多值而不是所有文本。我在这里做错了什么吗?我在“快速入门”下跟随Documentation。我正在使用 python 2.7

【问题讨论】:

    标签: python pdf pyquery


    【解决方案1】:

    它在 Bulk Data Scraping 下的那个页面下方说这句话:

    (以 ('with_formatter', 'text') 开头通常很有帮助,因此您会得到类似“Michaels”而不是 [] 的结果。有关更多信息,请参阅下面的特殊关键字。 )

    【讨论】:

      猜你喜欢
      • 2020-03-25
      • 1970-01-01
      • 1970-01-01
      • 2017-03-08
      • 1970-01-01
      • 2014-10-30
      • 1970-01-01
      • 1970-01-01
      • 2014-01-16
      相关资源
      最近更新 更多