【问题标题】:How can I read a Lucene document field tokens after they are analyzed?分析后如何读取 Lucene 文档字段标记?
【发布时间】:2011-07-22 14:53:37
【问题描述】:

如果我创建一个文档并添加一个既可存储又可分析的字段,我如何才能将该字段作为令牌列表读回?我有以下内容:

            Document doc = new Document();
            doc.add(new Field("url", fileName, Store.YES, Index.NOT_ANALYZED));
            doc.add(new Field("text", fileContent, Store.YES, Index.ANALYZED));
            // add the document to the index
            writer.addDocument(doc);

所以 fileContext 是一个包含大量文本的字符串。对其进行分析,从而在将其存储在索引中时对其进行标记化。但是,我怎样才能获得这些令牌?我可以在存储后从索引中检索文档,并且可以从文档中读取“文本”字段,但这是以字符串形式返回的。如果可能的话,我想获得代币。我的“作家”是一个 IndexWriter 实例,它使用 StandardAnalyzer。任何指针都会非常受欢迎。

非常感谢

【问题讨论】:

  • “令牌”到底是什么意思?

标签: lucene


【解决方案1】:

查看document.getField("name").tokenStreamValue()

编辑:实际上this question 使用上述TokenStream 为您提供了完整的解决方案。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-07-03
    • 1970-01-01
    • 1970-01-01
    • 2011-03-19
    • 2018-02-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多