【发布时间】:2017-11-20 04:39:32
【问题描述】:
我有一个表格结构的 PDF 文件,但我无法将它存储在数据库中,因为 PDF 文件是 Mangal 字体。
所以我遇到了两个问题:
- 从 PDF 中提取表格数据
- 文字是马拉地语
我已经使用以下代码为英语做到了这一点:
ITextExtractionStrategy strategy = new LocationTextExtractionStrategy();
string currentText = PdfTextExtractor.GetTextFromPage(pdfReader, i+1, strategy);
text.Append(currentText);
string rawPdfContent = Encoding.UTF8.GetString(Encoding.Convert(Encoding.UTF8, Encoding.UTF8, pdfReader.GetPageContent(i + 1)));
此编码提供表格结构但仅适用于英文字体,想知道马拉地语。
【问题讨论】:
-
PDF 是带标签的 PDF 吗?如果不是,那么这就解释了为什么您不能提取表数据。创建文档的人是否在制作连字时将正确提取马拉地语文本所需的信息存储在 PDF 中?如果不是,您认为任何软件如何能够以正确的顺序提取正确的字节?