【问题标题】:Is there an open-source self-learning stemmer?有开源的自学词干分析器吗?
【发布时间】:2013-04-09 16:46:00
【问题描述】:

我需要实现某种词干分析器/词形还原器。我有一些不同形式的单词(几千个)。它不是形态词典,只是其中的一小部分。从文件中自动学习词干分析器是个好主意吗?有没有可以使用的开源实现?

【问题讨论】:

  • 你需要它做什么? (根据应用,需要不同级别/类型的精度)
  • 那么,你实现了吗?
  • 不,最终没来得及

标签: nlp stemming morphological-analysis lemmatization


【解决方案1】:

Nuve 是一个用于突厥语的 NLP 库。一旦准备好语言规则和数据,它就可以分析和生成任何突厥语的单词,如果不是任何粘着语言的话。你可以 fork 并为 azeri 准备新的正字法和形态学文件。

https://github.com/hrzafer/nuve

由于我是作者,我很乐意为您提供帮助。

【讨论】:

    【解决方案2】:

    阿塞拜疆语是一种粘着性语言,类似于土耳其语,这意味着单词通常具有一连串后缀(例如,一个后缀表示复数,一个后缀表示宾格)。它还具有元音和声,这意味着每个后缀都有多个变体,您可以根据根中的元音选择正确的变体。

    我会做什么:

    • 标识后缀列表。我会尝试两种无监督的方法(?也许试试Linguistica?),并在谷歌上搜索后缀列表(这些通常只包含一个基本后缀,它会根据元音和谐而变化)。迭代地,您应该到达一些合理的列表。如果有疑问是否是后缀,我会把它扔进去。
    • 使用列表去除单词的后缀。

    生成的词干分析器会很吵,但根据您的需要,它可能无关紧要。

    【讨论】:

    • 有阿塞拜疆的服务。它不是开源的。 Azerbaijani stemmer 的演示页面在这里:nlp.jsoft.ws/stemming
    【解决方案3】:

    您应该查看由 John Goldsmith 和他的团队 (@UChicago) 为此目的开发的 Linguistica

    【讨论】:

      【解决方案4】:

      你说的是英语吗?那么请看 English lemmatizer databases?。考虑到大量异常,没有大型字典的机器学习方法似乎没有希望。

      【讨论】:

      • 不,这不是英语,否则我会使用现有的词形还原器。不幸的是,除了那几千个单词,我什么也没找到。而且我根本不会说这种语言。我不是在建议机器学习,我认为它不适用于这里。我正在考虑通过从单词列表中学习足够的内容来构建词干分析器(其中相同单词的不同形式)。
      猜你喜欢
      • 1970-01-01
      • 2014-10-01
      • 1970-01-01
      • 2011-09-01
      • 1970-01-01
      • 2011-05-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多