【发布时间】:2012-05-04 04:18:41
【问题描述】:
我想用中文搜索pdf中的文本。我正在使用 CGPDFScanner。我无法使用 CIDFontType2 获得正确的文本。
我的字体对象有 ToUnicode 条目
fontName 是 HFKAAO+LinGothic-Bold
它有CIDToGIDMap名称标识的条目(pdf文档说这意味着嵌入了truetype字体程序)
CIDSystemInfo
注册表是 Adobe
排序就是身份
它在 FontDescriptor 过滤器中有 FontFile2 条目和 FlateDecode
我发现有人说我只是对从 Tj 得到的文本进行充气,但这不起作用...我使用 zlib 对文本进行充气,似乎没有产生正确的数据。
有没有可以学习的示例代码?
我刚刚找到https://github.com/KurtCode/PDFKitten,但它不能与中文一起使用....
【问题讨论】: