【问题标题】:apache lucene tokensapache lucene 令牌
【发布时间】:2012-09-10 01:37:24
【问题描述】:

我开始试验 Apache Lucene Core 4,我的问题是…… 假设我创建了一些文本的索引,它存储在一个名为“context”的字段中 是否可以获得已成功索引的该字段的标记列表? 我正在查看 IndexReader 和 Field,但不知道如何检索令牌。

【问题讨论】:

  • 我记得你可以获得包含存储文本的文档。但我不知道您是否可以访问分析的令牌,我认为不能,因为这取决于您使用的 Tokenizer。在大多数情况下,您提供的所有文本(没有停用词等)都是标记。

标签: apache lucene indexing


【解决方案1】:

你有两个选择:

  • 您可以重新分析存储的字段,
  • 或使用term vectors(前提是您在索引时启用了术语向量)。

【讨论】:

  • 在创建索引时使用TextField是否可以指定创建词向量?
  • 不行,你需要创建自己的FieldType实例,然后在Field构造函数中使用
  • 有趣的是,我有一个文档术语的迭代器。是否可以找出每个术语的位置编号?
  • 你需要寻找你的任期,然后得到它的DocsAndPositionsEnum,nextPosition方法会给你职位编号。
猜你喜欢
  • 1970-01-01
  • 2013-07-02
  • 1970-01-01
  • 1970-01-01
  • 2010-10-13
  • 2017-01-28
  • 1970-01-01
  • 2015-11-11
  • 2019-08-29
相关资源
最近更新 更多