【问题标题】:pdf2json gives me a blank output txt file?pdf2json 给了我一个空白的输出 txt 文件?
【发布时间】:2016-10-11 23:28:45
【问题描述】:

我在他们的 github 上关注他们的“代码示例”指南。 https://github.com/modesty/pdf2json#code-example

在“解析 PDF 然后编写 .txt 文件(仅包含 PDF 的文本内容)”的示例中,我将确切的实现复制并粘贴到我的本地 JavaScript 文件中并调用它,但输出文本文件完全空白。

'use strict';

let fs = require('fs');
let PDFParser = require("pdf2json");

let pdfParser = new PDFParser();

pdfParser.on("pdfParser_dataError", errData => console.error(errData.parserError) );
pdfParser.on("pdfParser_dataReady", pdfData => {
    fs.writeFile("./node_modules/pdf2json/test/F1040EZ.content.txt", pdfParser.getRawTextContent());
});

pdfParser.loadPDF("./node_modules/pdf2json/test/pdf/fd/form/F1040EZ.pdf");

是不是我做错了什么?或者这对他们不起作用?还有没有安装其他二进制文件的 Nodejs 的 pdf 到文本转换器的替代品?

【问题讨论】:

  • 这是一个很大的话题。 pdf 标签指出“如果不借助光学字符识别 (OCR),可能无法从 PDF 中提取文本。字母可以编码为字体字形、艺术线条、矢量图形或光栅图像”。任何人都需要更多背景和示例 PDF 来提供进一步的建议。

标签: javascript node.js file pdf


【解决方案1】:

首页文档有点错误!为了使这项工作简单地设置为 PDFParser 参数 null 和 1

这个有效:

var fs = require("fs");

// https://github.com/modesty/pdf2json
var PDFParser = require("./node_modules/pdf2json/PDFParser");
var pdfParser = new PDFParser(this,1);

pdfParser.on("pdfParser_dataError", errData => console.error(errData.parserError));
pdfParser.on("pdfParser_dataReady", pdfData => {
    console.log(pdfParser)
    fs.writeFile("./content.txt", pdfParser.getRawTextContent());
});

HTH -XDVarpunen

pdf2json 中的问题链接:https://github.com/modesty/pdf2json/issues/76

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-11-16
    • 1970-01-01
    • 2021-10-09
    • 2021-10-08
    • 2016-08-07
    • 2020-04-03
    • 2022-06-15
    • 2014-04-02
    相关资源
    最近更新 更多