【问题标题】:Someone can give a simple explanation about the elements of Natural Language Processing?有人可以简单解释一下自然语言处理的要素吗?
【发布时间】:2011-10-14 19:55:28
【问题描述】:

我是自然语言处理的新手,对使用的术语感到困惑。

什么是标记化? POS标记?实体识别?

标记化只是将文本分割成可以有意义或赋予这些部分意义的部分?以及含义,当我确定某物是名词、动词或形容词时,它的名称是什么。如果我想划分为日期、名称、货币?

我需要简单解释一下 NLP 中使用的领域/术语。

【问题讨论】:

  • en.wikipedia.org/wiki/… 有什么让你困惑的地方?
  • @a3_nm 标记化让我感到困惑。
  • 为了快速入门 NLP,我建议在阅读 ntlk 书籍 (nltk.org/book) 时安装和使用 nltk 工具包:nltk.org。这本书很短,所以不会花你太多时间。

标签: nlp tokenize


【解决方案1】:

要回答您问题的更具体部分:标记化是将文本分成几部分(通常是单词),而不是太在意它们的含义。词性标注是在可能的词类(名词、动词等)之间消除歧义,它发生在标记化之后。识别日期、名称等称为命名实体识别 (NER)。

【讨论】:

    【解决方案2】:

    让我们举个例子

    My cat's name is Pat.  He likes to sit on the mat.
    

    标记化就是把这些句子变成我们所说的标记,基本上就是单词。这句话的标记是my, cat's, name, is, pat, he, likes, to sit, on, the, mat。 (有时您可能会将cat's 视为两个标记;这取决于个人喜好和意图,哈哈。)

    POS 代表词性,因此将这些句子标记为词性将是通过一个称为 POS 标记器的程序运行它,该程序将 label 句子中的每个标记为其部分-说话的。在这种情况下,斯坦福大学的一个小组编写的标注器的输出是:

    My_PRP$ cat_NN 's_POS name_NN is_VBZ Pat_NNP ._.
    He_PRP likes_VBZ to_TO sit_VB on_IN the_DT mat_NN ._.
    

    (这是一个很好的例子,cat's 被视为两个标记。)

    实体识别通常称为命名实体识别。这是获取像我们这样的文本并识别大部分是专有名词但也可以包括日期或您教识别器识别的任何其他内容的过程。对于我们的示例,命名实体识别系统将插入一个标签,如

    <NAME>Pat</NAME>
    

    为我们的猫的名字。如果还有一句像

    Pat is a part-time consultant for IBM in Yorktown Heights, New York.
    

    现在识别器将标记三个实体(总共四个,因为 Pat 将被标记两次)。

    <NAME>Pat</NAME>
    <ORGANIZATION>IBM</ORGANIZATION>
    <LOCATION>Yorktown Heights, New York</LOCATION>
    

    现在,所有这些工具的实际工作原理是另一回事。 :)

    【讨论】:

      【解决方案3】:

      补充dmn的解释:

      一般来说,在 NLP 中有两个你应该关注的主题:

      1. 统计与基于规则的分析

      2. 轻量级与重量级分析

      统计分析使用统计机器学习技术对文本进行分类,通常具有良好的精度和召回率。 基于规则的分析技术基本上使用手工构建的规则,并且具有非常好的精确度,但召回率很差(基本上它们可以识别规则中的案例,但仅此而已)。

      轻量级与重量级分析是您将在该领域看到的两种方法。一般来说,学术工作是重量级的,包括解析器、花哨的分类器和许多非常高科技的 NLP 东西。在工业界,总的来说,重点是数据,许多学术内容的扩展性很差,超出标准的统计或机器学习技术并不能带来太多好处。例如,解析在很大程度上是无用的(而且很慢),因此关键字和 ngram 分析实际上非常有用,尤其是当您有大量数据时。例如,谷歌翻译在幕后显然不是那么花哨 - 他们只是拥有如此多的数据,无论他们的翻译软件多么完善,他们都可以碾压其他人。

      这样做的结果是,工业上有很多机器学习和数学,但使用的 NLP 东西不是很复杂,因为复杂的东西真的不能很好地工作。更受欢迎的是使用用户数据,例如点击相关主题和机械土耳其人......这非常有效,因为人们比计算机更善于理解自然语言。

      解析就是把一个句子分解成词组,比如动词词组、名词词组、介词词组等,得到一个语法树。您可以使用online version of the Stanford Parser 来玩示例并了解解析器的功能。例如,假设我们有句子

      My cat's name is Pat.
      

      然后我们做词性标注:

      My/PRP$ cat/NN 's/POS name/NN is/VBZ Pat/NNP ./.
      

      使用 POS 标签和经过训练的统计解析器,我们得到一个解析树:

      (ROOT
        (S
          (NP
            (NP (PRP$ My) (NN cat) (POS 's))
            (NN name))
          (VP (VBZ is)
            (NP (NNP Pat)))
          (. .)))
      

      我们还可以进行一种稍微不同的解析,称为依赖解析:

      poss(cat-2, My-1)
      poss(name-4, cat-2)
      possessive(cat-2, 's-3)
      nsubj(Pat-6, name-4)
      cop(Pat-6, is-5)
      

      N-Grams 基本上是长度为 n 的相邻单词的集合。您可以查看 Google 数据 here 中的 n-gram。你也可以做字符 n-gram,它大量用于拼写纠正。

      情感分析是分析文本以提取人们对某事的感受或在哪些方面提及事物(例如品牌)。这涉及到大量查看表示情感的词。

      语义分析是分析文本的含义。这通常采用分类法和本体的形式,将概念组合在一起(狗、猫属于动物和宠物),但这是一个非常不发达的领域。 WordNet 和 Framenet 等资源在这里很有用。

      【讨论】:

      • 你能告诉我你写的东西的来源吗?它真的很有用,我想把它放在我期末成绩的关系中。
      • 对于统计与基于规则之间的划分,首先想到的是任何关于 BioNLP 竞赛结果的讨论,无论是 2009 年还是 2011 年。对于其他内容,只需查看任何 NLP 文本.您可以在柯林斯的论文中阅读依赖解析,我认为是 Nieve 的一本书(归纳依赖解析)。
      猜你喜欢
      • 2020-01-17
      • 2017-08-28
      • 2012-08-16
      • 2021-10-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-01-07
      相关资源
      最近更新 更多