【发布时间】:2021-07-19 12:55:06
【问题描述】:
我有一个波斯语的 pdf 代码,但是当我尝试复制内容时,内容将显示为无意义的字母(数字除外) 示例:我从我的 pdf 中复制了一些文本并将其粘贴到此处: 371960012100240806356111 => '371960012100240806356111' 数字粘贴在右边
但是当我尝试复制名称之类的内容时 它将被粘贴 £3⁄4ÉuÅ{
我该如何解决这个问题?我想用 python 提取内容,它可以工作,但我无法正确显示名称!
pdf 示例文件在这里:https://ufile.io/qibejys1
谢谢
【问题讨论】:
-
显然您的 PDF 不包含文本提取所需的信息。向 PDF 的发行商索要一个版本。
-
如果您提供有问题的 PDF 的链接,我们可以帮助您进行调查
-
@Kfcaio 我上传了一个示例文件
-
如上所述,PDF 不包含文本提取(ToUnicode 表或不言自明的编码 所需的信息b>),这样就行不通了。另一种方法是 光学识别 @Kfcaio 的回答提出的文本。
标签: python pdf text unicode utf-8