【发布时间】:2012-02-03 21:08:41
【问题描述】:
例如,我每个文档有几个标签。我可以
- 将它们索引为单个文本字符串,使用 WhiteSpaceTokenizer 按空格分割。 (例如“tag1 tag2 tag3”)
- 使用 KeywordAnalyzer (
例如
doc.addField("tags1", "tag1"); doc.addField("tags", "tag2"); doc.addField("tags", "tag23))
这两种方法都可以。问题是这些类型的索引的评分会有多大不同? (即字段归一化因子、tf/idf 计数、字段长度计算、斜率因子等)
【问题讨论】: