【问题标题】:Head-finding rules for noun phrases [closed]名词短语的寻头规则
【发布时间】:2012-05-05 01:21:07
【问题描述】:

Penn Treebank 格式不注释名词短语的内部结构,例如

(NP (JJ crude) (NN oil) (NNS prices))

(NP
    (NP (DT the) (JJ big) (JJ blue) (NN house))
    (SBAR
      (WHNP (WDT that))
      (S
        (VP (VBD was)
          (VP (VBN built)
            (PP (IN near)
              (NP (DT the) (NN river)))))))

我想提取头部(价格和房屋)。你知道有什么工具可以做到这一点吗?

【问题讨论】:

    标签: parsing nlp


    【解决方案1】:

    Michael Collins dissertation(附录 A)包括用于 Penn Treebank 的头部发现规则,这些规则运行良好且不难实施。但是,它们远非完美,因为这不是最简单的任务。

    David Vadas 和 James Curran 在 Penn Treebank 中关于 NP 结构的工作也可能是相关的:

    【讨论】:

    • 谢谢。柯林斯的第一条规则说:如果最后一个词被标记为 POS,则返回(最后一个词)。我不明白这一点。例如,在我的问题的第二个示例中,最后一个词是“河流”,它被标记为 (NN)。这是否意味着它会选择这个作为头部?这显然是错误的。
    • 如果最后一个词被标记为POS(所有格结尾),这个词将被标记为头部。对于 NP “the river”,在从右到左搜索 NN、NNP 等时,会返回 “river” 作为头部。为什么 “river” 作为 “the river” 的头部是错误的?
    • 啊,我明白你现在在问什么了。这些规则一次只查看一个与上下文无关的规则,即给定 NP 节点的直接子节点,而不是在树的更下方。因此,对于规则 NP -> NP SBAR,它是顶级 NP,它看起来从右到左并标记为头部 NP (NP -> NP' SBAR)。在“蓝色大房子”内,会重复整个过程,将“房子”标记为头部(NP -> DT JJ JJ NN')。
    • 感谢您的澄清。我对“POS”感到困惑。我最初认为柯林斯的意思是“词性”,而不是“占有欲”。
    • 你知道柯林斯所说的$是什么意思吗? Penn Treebank 中没有“$”标签。
    【解决方案2】:

    正如 aab 所建议的,简单的确定性寻头规则可以很好地工作(另请参阅 Magerman 或 Charniak 寻头规则以了解类似方法)。

    您还可以考虑从组成树中提取依赖结构。斯坦福工具集在这方面做得很好: 见http://nlp.stanford.edu/software/stanford-dependencies.shtml

    【讨论】:

      【解决方案3】:

      你也可以在Dan Bikel的论文中找到英文的head find rules(如果你需要源代码,你可以在他的解析器软件主页找到)

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2013-11-09
        • 2013-12-08
        • 2017-11-23
        • 1970-01-01
        相关资源
        最近更新 更多