【问题标题】:Term extraction: Generatings tags out of text术语提取:从文本中生成标签
【发布时间】:2010-11-09 04:33:28
【问题描述】:

如何得到与http://developer.yahoo.com/search/content/V1/termExtraction.html相同的结果

这个问题已经被问过很多次了。

尝试使用现有解决方案解决此问题时,我偶然发现 Solr 在按http://wiki.apache.org/solr/AnalyzersTokenizersTokenFilters 中所述进行索引之前对文档执行“文本分析” - 其中也包括词干提取。

因此最终索引将主要由用于描述文档的术语组成。

是否有提供分析器、标记器和标记过滤器以供直接使用的解决方案?如果 solr 是出路,那么从 solr 的索引中获取这些数据的最佳方法是什么?

【问题讨论】:

    标签: parsing tags solr tokenize


    【解决方案1】:

    只需询问已解析的术语,例如

    http://localhost:8983/solr/terms?terms.fl=text&terms.sort=count&terms.limit=-1
    

    TermsComponent 了解更多信息。

    【讨论】:

      【解决方案2】:

      Solr 是一种创建自定义搜索引擎的方法。它似乎不是这项工作的正确工具。 Wikipedia article about term extraction 在其“外部链接”部分列出了几个用于术语提取的 Web 应用程序。 OpenNLP 有一个可能有用的工具列表。 Its Chunker 可能会有所帮助。

      【讨论】:

      • 是的,Solr 术语只会返回唯一标记(可能减去一些常用词,并进行词干提取等)。它不会真正告诉您文本中的重要内容。对于它的价值,您可以通过wiki.apache.org/solr/TermsComponent 从 solr 中吸取这些条款
      猜你喜欢
      • 2012-09-04
      • 1970-01-01
      • 2010-12-09
      • 2021-05-05
      • 2020-03-08
      • 1970-01-01
      • 1970-01-01
      • 2011-02-09
      相关资源
      最近更新 更多