【发布时间】:2019-02-04 09:09:19
【问题描述】:
我使用的 solr 版本是 7.6.0(无模式模式)。我尝试使用默认提供的 Post 实用程序 jar 来索引几个 PDF 文档。现在,当我进行查询时,包含查询字符串的文件的详细信息会正确显示。但我看不到任何显示文件实际内容的字段。我的 Solrconfig.xml 的请求处理程序如下所示
<requestHandler name="/update/extract" startup="lazy" class="solr.extraction.ExtractingRequestHandler" >
<lst name="defaults">
<str name="uprefix">ignored_</str>
<str name="fmap.a">ignored_</str>
<str name="fmap.div">ignored_</str>
<str name="fmap.content">text</str>
<str name="captureAttr">true</str>
<str name="lowernames">true</str>
<bool name="ignoreTikaException">true</bool>
</lst>
</requestHandler>
发布用于索引的 pdf 文件时,自动生成的 managed-schema.xml 文件中不包含任何“内容”字段。此外,在查询时,仅显示文件的元数据,如 id、日期、标题、内容类型、流大小、作者等,但不突出显示实际内容信息。请澄清。 "http://localhost:8983/solr/TestCore6/select?hl=on&q=mars&wt=json"
【问题讨论】:
-
您是否共享托管架构文件?内容字段是否在字段定义中有stored=true?
-
hl.fl 指定要突出显示的字段列表。
-
谢谢阿比吉特!但在我的 managed-schema.xml 文件中,没有仅生成内容的文件。相反,还有其他字段,如下所示:
-
您要搜索哪个字段?
-
CarsH.pdf:现代集团是一家总部位于首尔的韩国商业集团。本田汽车是日本上市的跨国集团公司 CarsS.pdf:SWIFT 是全球领先的安全金融信息服务提供商。了解我们如何追求卓越运营。问题:我的两个 pdf 字段都已编入索引。现在,当我尝试将查询“q”作为“现代”提供时,从管理控制台检索正确文件 CarsH.pdf 的元数据,其中包含文件名、作者、标题等详细信息,但不是该段落几行的原始内容。
标签: pdf post solr apache-tika