PoDoFo 没有提供从文档中轻松提取文本的方法,但并不难做到。
将文档加载到PdfMemDocument:
PoDoFo::PdfMemDocument pdf("mydoc.pdf");
遍历每一页:
for (int pn = 0; pn < pdf.GetPageCount(); ++pn) {
PoDoFo::PdfPage* page = pdf.GetPage(pn);
遍历该页面上的所有 PDF 命令:
PoDoFo::PdfContentsTokenizer tok(page);
const char* token = nullptr;
PoDoFo::PdfVariant var;
PoDoFo::EPdfContentsType type;
while (tok.ReadNext(type, token, var)) {
switch (type) {
case PoDoFo::ePdfContentsType_Keyword:
// process token: it contains the current command
// pop from var stack as necessary
break;
case PoDoFo::ePdfContentsType_Variant:
// process var: push it onto a stack
break;
default:
// should not happen!
break;
}
}
}
“进程令牌”和“进程变量”cmets 是它变得更复杂的地方。您将获得要处理的原始 PDF 命令。幸运的是,如果您实际上并没有渲染页面并且您想要的只是文本,您可以忽略其中的大部分。您需要处理的命令是:
BT, ET, Td, TD, Ts, T, Tm, Tf, ", TJ, @9867654336@, @987654334
BT 和 ET 命令标记文本流的开始和结束,因此您希望忽略不在 BT/ET 对之间的任何内容。
PDF 语言基于 RPN。命令流由压入堆栈的值和将值从堆栈中弹出并处理它们的命令组成。
"、'、Tj 和 TJ 命令是唯一实际生成文本的命令。 "、' 和 Tj 返回单个字符串。使用var.IsString() 和var.GetString() 进行处理。
TJ 返回一个字符串数组。您可以使用以下方法提取每个:
if (var.isArray()) {
PoDoFo::PdfArray& a = var.GetArray();
for (size_t i = 0; i < a.GetSize(); ++i)
if (a[i].IsString())
// do something with a[i].GetString()
其他命令用于确定何时引入换行符。 " 和 ' 也引入了换行符。最好的办法是从 Adobe 下载 PDF 规范并查找文本处理部分。它更详细地解释了每个命令的作用。
我发现编写一个小程序非常有帮助,该程序获取 PDF 文件并转储每个页面的命令流。
注意:如果您所做的只是提取没有定位信息的原始文本,您实际上不需要维护一堆var 值。所有的文本渲染命令最多只有一个参数。您可以简单地假设var 中的最后一个值包含当前命令的参数。