【发布时间】:2017-02-06 17:25:31
【问题描述】:
使用 iTextSharp,我正在尝试从以下 pdf 文件中提取文本:
https://www.treasury.gov/ofac/downloads/sdnlist.pdf
这是代码:
var currentText = PdfTextExtractor.GetTextFromPage(pdfReader, 2, new SimpleTextExtractionStrategy());
if (currentText.Length > 0)
{
var capture = new Capture();
capture.Text = currentText;
// write the results to the DB, if any data was found
_dataService.AddCapture(capture);
}
使用 SimpleTextExtractionStrategy,将结果写入数据库,单词中包含无数不需要的空格。第2页的前几行写成:
外国资产控制办公室特别指定的国民和受阻人员 2017 年 2 月 3 日 - 2 - A.A.树莓派;一个.k。 一种。 AL MAZ -AN TEY MSDB;又名AL MAZ -ANTEY PV O 'AI R DEFENSE' CO NCERN LEAD SYSTEM M S DESIGN BUREAU OAO ' OPEN JO INT -STOCK COMPANY' IMNI ACADEMIC IAN A.A .拉斯普林;又名去爱吧 SISTEMN OYE KONS TRUKT ORSKOY E BYURO OPEN J OIN T-S TOCK C OMP ANY ALMAZ -AN TEY PVO 关注 I Men I ACADEMICIAN A .A.锉锡; 又名一种。 JO INT STOCK COMPANY A LMA Z-AN TEY AI R DEFENSE CON CERN 由 ACADE MICIAN A.A. 命名的系统设计局硕士
例如,请参见第 4 行和第 6 行中的单词“JO INT”,以及倒数第二行中的单词“CON CERN”。这些类型的空间出现在整个结果中。不幸的是,这将使查询文本变得不可能。
有谁知道为什么会这样以及如何解决这个问题?
【问题讨论】:
标签: pdf itext text-extraction