【问题标题】:solr plain text tokenizesolr 纯文本标记化
【发布时间】:2015-11-19 10:56:15
【问题描述】:

我有一堆只有颜色代码的文本文件。频率是给定颜色在文件中出现的次数。

000009 000009 000009 000009 000009 000009 000009 000009 000009 000009 000009 00000b 00000b 00000b 00000c 00000c 00000c 00000c 00000e 00000e

我已经看到了这个http://www.slideshare.net/clbecker/lucene-revnov2014,我正在努力让 solr-part 正确。我已经使用 white-space-tokenizer 定义了一个文件类型,并添加了一个该类型的字段。问题是我不知道如何按原样导入文件。如何告诉 solr (solr 5) 使用该标记器提取内容?我想我可以把它做成一个结构化文件(csv),然后用标准的方式来做——比如 solr/update --data @csv-file。但是对于这样一个简单的文件来说似乎有点过分了。

【问题讨论】:

    标签: solr tokenize


    【解决方案1】:

    【讨论】:

    • 但这不是用于基于 tika 的更新还是标准类型 - csv、json?这更简单 - 所有内容都只是一种字段类型。
    • 所以,您只有一个包含一个字段的 CSV。您的文档代表一个图像。不过,您可能想考虑一下您想为 ID 做什么。使用 UpdateRequestProcessor 链自动生成它们或调整架构以不具有它们。当然,拥有它们更好。
    • 我期望过高或对 solr 的理解不够好。我确实必须将我的数据变成结构化的东西。这实际上是很少的工作——最终得到了 json 和两个字段。谢谢
    猜你喜欢
    • 2010-12-21
    • 1970-01-01
    • 2019-01-01
    • 2014-02-25
    • 1970-01-01
    • 2014-04-21
    • 1970-01-01
    • 1970-01-01
    • 2022-10-25
    相关资源
    最近更新 更多