【发布时间】:2010-11-09 04:33:28
【问题描述】:
如何得到与http://developer.yahoo.com/search/content/V1/termExtraction.html相同的结果
这个问题已经被问过很多次了。
尝试使用现有解决方案解决此问题时,我偶然发现 Solr 在按http://wiki.apache.org/solr/AnalyzersTokenizersTokenFilters 中所述进行索引之前对文档执行“文本分析” - 其中也包括词干提取。
因此最终索引将主要由用于描述文档的术语组成。
是否有提供分析器、标记器和标记过滤器以供直接使用的解决方案?如果 solr 是出路,那么从 solr 的索引中获取这些数据的最佳方法是什么?
【问题讨论】:
标签: parsing tags solr tokenize