【发布时间】:2017-10-10 14:11:18
【问题描述】:
我今天在我的 debian 服务器中实现了 solr 6.5.1,但我无法获取 pdf 文本内容。搜索没问题,因为当我查询我的名字时,文档看起来没问题:“juan”。但是,每个 str 结果并没有出现它应该如何做。
这是示例查询:
结果如下:
<response>
<lst name="responseHeader">
<int name="status">0</int>
<int name="QTime">1</int>
<lst name="params">
<str name="hl.snippets">20</str>
<str name="q">juan</str>
<str name="hl">true</str>
<str name="fl">title</str>
<str name="hl.usePhraseHighlighter">true</str>
<str name="hl.fl">content</str>
<str name="wt">xml</str>
</lst>
</lst>
<result name="response" numFound="1" start="0">
<doc>
<arr name="title">
<str>CV_Juan_Jara_ultimo</str>
</arr>
</doc>
</result>
<lst name="highlighting">
<lst name="/solr-6.5.1/mydocs/CV_Juan_Jara_ultimo.pdf"/>
</lst>
</response>
此外,日志显示所有 pdf 文本,因此我假设它已正确编入索引(我使用以下命令为 pdf 编入索引:bin/post -c ex mydocs/CV_Juan_Jara_ultimo.pdf)。
我使用 curl 将“内容”字段添加到架构中:
curl -X POST -H 'Content-type:application/json' --data-binary '{
"add-field" : {
"name":"text",
"type":"text_general",
"indexed":"true",
"stored":"false",
"multiValued":"true"
}
}' localhost:8983/solr/ex/schema
你知道哪里出了问题吗?
我要做的就是在我的 pdf 中搜索一个主题,然后像这样突出显示所有结果:
【问题讨论】:
标签: pdf curl text solr highlighting