【问题标题】:problem in displaying pasted content form persian pdf显示粘贴内容表单波斯语pdf的问题
【发布时间】:2021-07-19 12:55:06
【问题描述】:

我有一个波斯语的 pdf 代码,但是当我尝试复制内容时,内容将显示为无意义的字母(数字除外) 示例:我从我的 pdf 中复制了一些文本并将其粘贴到此处: 371960012100240806356111 => '371960012100240806356111' 数字粘贴在右边


但是当我尝试复制名称之类的内容时 ​​​​ 它将被粘贴 £3⁄4ÉuÅ{

我该如何解决这个问题?我想用 python 提取内容,它可以工作,但我无法正确显示名称!

pdf 示例文件在这里:https://ufile.io/qibejys1

谢谢

【问题讨论】:

  • 显然您的 PDF 不包含文本提取所需的信息。向 PDF 的发行商索要一个版本。
  • 如果您提供有问题的 PDF 的链接,我们可以帮助您进行调查
  • @Kfcaio 我上传了一个示例文件
  • 如上所述,PDF 不包含文本提取ToUnicode 表或不言自明的编码 所需的信息b>),这样就行不通了。另一种方法是 光学识别 @Kfcaio 的回答提出的文本。

标签: python pdf text unicode utf-8


【解决方案1】:

您可能想尝试以下步骤:

  1. 安装 Tesseract 4 或更高版本,检查official tutorial
  2. 获取 Persian-specific model 并将其复制到本地 tessdata 文件夹
  3. 将有问题的PDF页面(先分页,看看pdftk工具)转为tiff(在ubuntu中,使用convert命令)
  4. 运行类似tesseract -l fas image.tiff text.txt
  5. 使用选项调整您的命令,例如 psm

【讨论】:

猜你喜欢
  • 2015-10-04
  • 1970-01-01
  • 2020-04-17
  • 2016-12-22
  • 2020-10-25
  • 2022-08-10
  • 1970-01-01
  • 2011-07-25
  • 1970-01-01
相关资源
最近更新 更多