【问题标题】:How to convert XML annotations [xmin,ymin,xmax,ymax] to tabula area?如何将 XML 注释 [xmin,ymin,xmax,ymax] 转换为表格区域?
【发布时间】:2021-03-25 19:22:24
【问题描述】:

我们正在使用 Retinanet 对象检测器模型来检测并从我们的表中提取数据。在使用 1000 多个图像注释后,我们得到了一个很好的模型。然而,当我们想要提取数据时,我们的问题就出现了。最常用的是 Camelot,但它并没有像我们希望的那样工作,所以我们尝试使用 tabula 代替。当我们在 area 参数中使用 XML 注释时,它不起作用。环顾四周后,我们发现表格仅使用 PDF 点单位。如何将 XML 点转换为 PDF 点单位?图像检测如下:

Detected table

【问题讨论】:

    标签: data-extraction tabula


    【解决方案1】:

    这取决于视网膜网络使用哪些单位。 PDF 点定义为 1/72 英寸,因此您还需要知道源图像的分辨率(以每英寸点数为单位)。

    请记住,Tabula 不适用于光栅(图像)PDF。

    见:Converting Pixels and Inches to PostScript Points

    【讨论】:

    • 感谢您的回复,非常感谢。我们使用 images.info['dpi'] 获得了图像 dpi 值,结果为 200(我们从 pdf 创建用于检测的图像)。正如您所说,pdf 点是 1/72 英寸,我们计算出比率为 72/200 = 0.36,然后通过乘以这个因子来转换我们的 x,y 坐标,它就像一个魅力。
    • 乐于助人!顺便说一句,我是 Tabula 的维护者之一。我们很乐意改进我们的表格检测功能,所以如果您的结果可以分享,我会很乐意与您交流 :)
    猜你喜欢
    • 1970-01-01
    • 2019-11-20
    • 1970-01-01
    • 2018-08-07
    • 2021-10-30
    • 1970-01-01
    • 1970-01-01
    • 2022-12-14
    • 2017-10-02
    相关资源
    最近更新 更多