【发布时间】:2020-12-18 00:57:02
【问题描述】:
我正在通过命令行上的 SimplePostTool 将 HTML 文档索引到 Solr,
post -c core0 /mnt/Vancouver/programming/datasci/solr/test/d*.html
尽管对 solrconfig.xml 和 schema.xml(solr.HTMLStripCharFilterFactory 等)进行了各种编辑,但 Solr 不会保留 HTML 源文档中存在的 HTML 内容(URL)。
A new <a href="https://news.ucr.edu/articles/2020/11/06/chemicals-your-living-room-cause-diabetes">UC Riverside study</a> shows flame retardants ...
在 Solr 中显示为
"p":[" A new https://news.ucr.edu/articles/2020/11/06/chemicals-your-living-room-cause-diabetes UC Riverside study shows ...
似乎 Apache Tika 正在从 HTML 中的内容中剥离 HTML 编码
元素,在传递给 Solr 之前。
呈现的网页(注意,例如,一个新的 https://news.ucr.edu/articles/2020/11/06/chemicals-your-living-room-cause-diabetes UC Riverside 研究 ... i> 在第一个文件中)
【问题讨论】:
标签: solr apache-tika