【发布时间】:2014-02-15 22:33:25
【问题描述】:
问题
我有 500 多个 PDF 文件,我需要搜索一组关键字的实例,并为每组关键字在文件中使用的次数打分(最好是转储到 CSV 文件中)。
例如我可以有以下
keyword-set-1 = "foo" "bar";
keyword-set-2 = "jon" "doe";
以及带有以下文本的 PDF 文件
"jon doe and mary doe are both at the bar."
这会给我以下分数
keyword-set-1 = 3 (jon, doe and doe)
keyword-set-2 = 1 (bar)
我已经做了什么
如果我正在搜索纯文本文件,我已经找到了多种可以在 PHP 或 Java 中执行此操作的方法。但是,我还没有找到 PDF 文件的单一解决方案。我考虑过使用 PDF miner 将所有 PDF 转换为纯文本,但是如果可能的话,我宁愿避免这种情况。
PDF 是高质量的,不是扫描的表格。
【问题讨论】:
标签: pdf