【发布时间】:2022-11-11 06:00:54
【问题描述】:
我目前正在尝试使用 texttractor python 库 (https://github.com/aws-samples/amazon-textract-textractor/) 使用 Amazon Textract 处理 pdf。
我已经能够调用 API 并使用库返回结果,但导出键值似乎没有任何特定的逻辑顺序。
我正在尝试处理一个多页申请表,它有多个字段具有相同的键(例如是/否),并希望使用该顺序来识别哪个属于哪个问题。
下面的脚本:
from textractor import Textractor
from textractor.data.constants import TextractFeatures
extractor = Textractor(profile_name="default")
document = extractor.start_document_analysis(
file_source=("Application Form trimmed.pdf"),
features=[TextractFeatures.FORMS],
s3_upload_path="s3://textractbucket2/"
)
document.export_kv_to_csv(
include_kv=True,
include_checkboxes=True,
filepath="async_kv.csv"
)
【问题讨论】:
-
pdf很少按顺序编写,注释更少,因此作者添加一个然后另一个然后转到顶部添加一个。就像封面页可能是添加到小说的最后一页或索引的一半。 PDF 在运行时逐页构建以重新排序为页面顺序,但页面内容不必自上而下跟随,因为激光打印机可以简单地在旋转的页面鼓上旋转而没有任何问题