【问题标题】:JAPE rule distinguishing documentsJAPE 规则区分文件
【发布时间】:2017-08-12 20:20:34
【问题描述】:

我目前正在尝试编写一个 JAPE 规则,该规则可以识别来自原始研究文章的评论。 假设我想强调一个短语,如“在这篇评论中我们讨论......”、“评论总结......”等等。 现在我有:

Phase: Review
Input: Token
Options: control = appelt

Macro: REVIEWTERM
({Token.string ==~ "[Rr]eview"} |
{Token.string ==~ "[Oo]verview"} |
{Token.string ==~ "[Mm]inireview"} |
{Token.string ==~ "[Ss]tudies"} |
{!Token.string == "trial"} |
{!Token.string == "case", !Token.string == "report"})

Rule: Mainreview
(
({Token.category == "IN"})?
({Token.category == "DT"})?
(REVIEWTERM)
({Token.category == "PRP"})?
{Token.category == "VBZ"}
): review -->
:review.Review = {rule = Mainreview}

但它不能正常工作。请问哪里出错了?

【问题讨论】:

    标签: nlp gate


    【解决方案1】:

    首先我建议替换宏的选项,如

    {Token.string ==~ "[Rr]eview"}

    使用具有这些值的地名词典,其中区分大小写标志设置为 false 。

    从 MainReview 规则我可以​​看到你有一个稳定的规则 (REVIEWTERM) (VBZ)

    请确保:

    a) 您的 POS Tagger 在此 JAPE 规则之前执行(只是为了确保)

    b) 您的词性标注器为上述示例生成 VBZ 类别

    如果没有帮助 - 请告诉我,我会尝试在我的环境中运行此规则。

    【讨论】:

    • 感谢您的回答! a) POS 标注器在 JAPE 转换器之前执行。 b) 大多数单词“review”后面跟着一个单词,这就是我选择VBZ类别的原因。该规则适用于主题中的短语,但它也突出显示诸如“IBD is”、“and is”之类的垃圾,这不是我正在寻找的评论文章的标志
    【解决方案2】:

    在我看来,由于{!Token.string == "trial"} | {!Token.string == "case", !Token.string == "report"} 部分,几乎所有令牌都会触发宏REVIEWTERM。它将匹配除试验、案例或报告之外的任何令牌。

    因此,您当前的规则 Mainreview 或多或少地给了我任何令牌,后跟 VBZ(由 PRP 分隔或不分隔)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-10-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多