【发布时间】:2014-08-20 13:33:51
【问题描述】:
我们正在使用 Solr 和 Lucene 构建 PDF 搜索机器,用户可以在其中搜索 PDF 中的文本。该数据库仅包含 PDF。
在搜索结果页面(“/browse”)中,我们希望在 PDF 文件后面附加#page=X,其中 X 是找到文本的页面。 (如果使用锚标记指定,Adobe Acrobat 会自动滚动到特定页面。)
例如,如果我搜索 foobar 并且有一个 pdf 文档,其中 foobar 在第 5 页,则链接应该是 http://pdfserver/pdfs/pdf.pdf#page=5(注意末尾的锚点)。
- 这可能吗?
- 我们如何获得这个页码?
【问题讨论】:
-
我不认为我理解你真正想要达到的目标。您想索引 pdf 文件以及您进行的任何搜索以返回匹配文本的页码还是其他内容?
-
正是如此。因此,如果我搜索“foobar”并且有一个 pdf 文档,其中“foobar”在第 5 页,则链接应该是 pdfserver/pdfs/pdf.pdf#page=5
-
您找到解决方案了吗?索引大量 PDF 文件时似乎是一项基本要求。
-
@MrTelly,我使用了#search 解决方案并对搜索词进行 URL 编码。