【问题标题】:how to use weka in keyphrase extraction from text arguments如何在从文本参数中提取关键短语时使用 weka
【发布时间】:2013-11-28 21:44:52
【问题描述】:

我正在做一个项目“从文本参数中提取关键短语”。为此,我首先进行了输入清理,然后使用 stanford 解析器(POS 标记)确定了候选短语列表(总共约 300 个)。然后我计算了每个短语的特征值。我对数据集中的每个文档都遵循了这些步骤。现在我应该如何进行,即如何使用 WEKA 来查找关键词。我应该如何在 weka 中存储短语和特征值(TFXIDF)。如何找到最终项目的效率??

【问题讨论】:

    标签: weka


    【解决方案1】:

    WEKA 在文本分类 任务(如文本分类和聚类)方面做了出色而简单的工作,其中实例是相对较长的文本片段(例如从推文到文档)和类(可用时)是不重叠的标签(例如经济/体育/...等主题类、垃圾邮件/合法电子邮件、情绪分析中的正面/负面等)。

    但是 WEKA 不适合直接的术语分类任务,例如 Part Of Specch 标记、词义消歧、命名实体识别,或者在您的情况下,关键短语提取。要应用 WEKA,您不仅需要原始文本和手动提取的关键短语,还需要确定使这些文本成为实际关键短语的属性。您必须检查您的示例,并确定,例如,关键阶段中单词的词性和周围的单词实际上很重要,以便猜测一段文本是关键短语。

    我强烈建议您查看 CONLL NER 共享任务(CONLL 20022003)中使用的数据集中使用的表示。命名实体中的每个单词都是独立的,并被标记为命名实体的开头、中间或结尾。此外,您可以使用的功能是实际单词、周围单词及其词性。

    例如,在 NER 2003 数据集的示例中:

       U.N.         NNP  I-NP  I-ORG 
       official     NN   I-NP  O 
       Ekeus        NNP  I-NP  I-PER 
       heads        VBZ  I-VP  O 
       for          IN   I-PP  O 
    

    你知道“Ekeus”这个词是一个NNP,它在一个名词短语(I-NP)中,它是一个“人”类型的命名实体(I-PER)。您可以处理此格式以获取一个实例文件,在该文件中您使用 POS 标签和两个单词窗口中的实际单词:

    @attribute word-2 string
    @attribute word-1 string
    @attribute word string
    @attribute word+1 string
    @attribute word+2 string
    @attribute postag-2 {NNP, NN, ....} // The full list of available POS tags
    @attribute postag-1 {NNP, NN, ....}
    // ../..
    @attribute named-entity-class {O, I-PER, I-ORG, ...} // The full list of possible NE tags
    
    @data
    "U.N.","official","Ekeus","heads","for",NNP,NN,NNP,VBZ,IN,I-PER
    ../..
    

    如您所见,您必须确定每个单词所需的属性并使用这些属性构建窗口。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-11-29
      • 1970-01-01
      • 1970-01-01
      • 2020-08-16
      • 2022-01-09
      • 1970-01-01
      • 2019-08-16
      • 1970-01-01
      相关资源
      最近更新 更多