【问题标题】:solr how to do filter on html entitysolr如何对html实体进行过滤
【发布时间】:2018-05-15 13:30:14
【问题描述】:

我在索引时间分析器中使用了 htmlStripCharater 过滤器,所以所有的 html 字符都被解码了,例如-® 将被索引为 ® 我已经这样做了,因为我们正在做一些内部 NLP 事情,它正在服务目的很好。

当我尝试执行过滤查询时出现问题。 示例我有一个品牌 - 你好世界®。当像 brand%3AhelloWorld%C2%AE solr 一样执行过滤器查询时,再次将 % 更改为 %25 。 所以查询实际上是 brand%253AhelloWorld%25C2%25AE ,我无法从 solr 获取数据。

知道如何解决这个问题吗? 我正在使用旧的 solr 版本 4.10。

【问题讨论】:

    标签: solr solrj solr4 solrcloud solrnet


    【解决方案1】:

    如果您使用的是DataImportHandler,则可以使用HTMLStripTransformer

    否则,您必须自己实现此客户端。如果您的客户端是 .NET,您可以使用 HtmlAgilityPack

    【讨论】:

    • 即使您使用 HTMLStripTransformer ,也不会产生任何影响。因为问题出在查询端。
    猜你喜欢
    • 1970-01-01
    • 2011-09-06
    • 2019-07-22
    • 1970-01-01
    • 2013-04-27
    • 2012-08-18
    • 2020-05-16
    • 1970-01-01
    • 2012-02-26
    相关资源
    最近更新 更多