【发布时间】:2021-04-17 19:44:08
【问题描述】:
我在节点 cli 脚本中使用 pdf.js-extractor。我正在尝试提取问题和答案的数据库,然后处理文件将具有以下结构:
[
'324',
' ',
"Di quale dei seguenti arcipelaghi fa parte l'isola di ",
'Delle isole Ponziane',
' ',
'Delle isole Pelagie',
' ',
'Delle isole Egadi',
' ',
'Delle isole Eolie',
' ',
'C',
' '
],
[ 'Favignana?', ' ' ],
[
'325',
' ',
'Di quale di queste città la cattedrale di Santa Maria ',
'Napoli',
' ',
'Firenze',
' ',
'Roma',
' ',
'Genova',
' ',
'B',
' '
],
[ 'del Fiore è conosciuta semplicemente come il ' ],
[ 'Duomo?', ' ' ]
我注意到 pdf 内容以错误的方式拆分,答案和正确答案字母之一被正确列出,但问题会以一种磨损的方式显示。
每个问题的预期正确格式如下
[
'324',
"Di quale dei seguenti arcipelaghi fa parte l'isola di Favignana?",
'Delle isole Ponziane',
'Delle isole Pelagie',
'Delle isole Egadi',
'Delle isole Eolie',
'C', // correct answer letter
],
[
'325',
'Di quale di queste città la cattedrale di Santa Maria del Fiore è conosciuta semplicemente come il Duomo?',
'Napoli',
'Firenze',
'Roma',
'Genova',
'B', // this is the correct answer letter
]
我正在使用此代码处理 pdf
pdf.extract(pdfFile, {
firstPage: 2,
normalizeWhitespace: true
}).then( (data) => {
//console.log(data);
spinner.stop();
data.pages.forEach( (page) => {
const lines = PdfExtract.utils.pageToLines(page, 1);
const rows = PdfExtract.utils.extractTextRows(lines);
fileContent.push(rows);
});
fileContent = fileContent.map( (row) => {
return row.join('');
});
console.log(fileContent);
}).catch( (error) => console.log(error) );
如何正确提取pdf内容并解决问题?
【问题讨论】:
标签: javascript node.js pdf