【发布时间】:2019-06-07 17:13:08
【问题描述】:
MATLAB 提供了extractFileText 函数,它允许我们从 PDF 文件以及其他文件格式中读取文本,并将提取的文本保存为字符串。
我们可以向这个函数传递一个额外的参数,以便从文档的特定页面中提取文本。
例如,从示例exampleSonnets.pdf 文件中提取第 3、5 和 7 页的文本:
str = extractFileText("exampleSonnets.pdf", 'Pages', [3 5 7]);
但是,此功能不提供一种方法来找出 PDF 文档包含的总页数预先。
所以如果我们碰巧做了这样的事情:
str = extractFileText("exampleSonnets.pdf", 'Pages', [99 100]);
抛出以下错误:
Error using extractFileText (line 95)
No page 100 in file. Maximum page number: 47.
警告我们,我们请求的页码超出了文档中的实际总页数。
这很好。
但是,我如何事先知道 PDF 文档中的总页数,而不触发错误,以便我可以安全地将搜索范围缩小到最大页数?
有这个功能吗?
【问题讨论】: