【发布时间】:2016-10-11 23:28:45
【问题描述】:
我在他们的 github 上关注他们的“代码示例”指南。 https://github.com/modesty/pdf2json#code-example
在“解析 PDF 然后编写 .txt 文件(仅包含 PDF 的文本内容)”的示例中,我将确切的实现复制并粘贴到我的本地 JavaScript 文件中并调用它,但输出文本文件完全空白。
'use strict';
let fs = require('fs');
let PDFParser = require("pdf2json");
let pdfParser = new PDFParser();
pdfParser.on("pdfParser_dataError", errData => console.error(errData.parserError) );
pdfParser.on("pdfParser_dataReady", pdfData => {
fs.writeFile("./node_modules/pdf2json/test/F1040EZ.content.txt", pdfParser.getRawTextContent());
});
pdfParser.loadPDF("./node_modules/pdf2json/test/pdf/fd/form/F1040EZ.pdf");
是不是我做错了什么?或者这对他们不起作用?还有没有安装其他二进制文件的 Nodejs 的 pdf 到文本转换器的替代品?
【问题讨论】:
-
这是一个很大的话题。 pdf 标签指出“如果不借助光学字符识别 (OCR),可能无法从 PDF 中提取文本。字母可以编码为字体字形、艺术线条、矢量图形或光栅图像”。任何人都需要更多背景和示例 PDF 来提供进一步的建议。
标签: javascript node.js file pdf