【问题标题】:Automatic Summarization : Extraction Based [closed]自动摘要:基于提取[关闭]
【发布时间】:2017-08-08 14:58:46
【问题描述】:

什么是基于提取的自动摘要算法? google了很多,没找到相关的。我想在python上实现算法

【问题讨论】:

    标签: python nlp summarization


    【解决方案1】:

    没有一种单一的算法可用于基于提取的摘要。有几种不同的算法可供选择。您应该选择适合您特定需求的一种。

    基于提取的摘要有两种方法:

    • 监督学习 - 为程序提供大量文档示例及其关键字。该程序学习什么构成了关键字。然后你给它一个新文档,这次没有任何关键字,程序会根据它在训练阶段学到的内容提取这个文档的关键字。有大量的监督学习技术。仅举几例,有神经网络、决策树、随机森林和支持向量机。

    • 无监督学习 - 您只需给程序一个文档,它就会创建一个关键字列表,而无需依赖任何过去的经验。 TextRank 是一种流行的基于提取的无监督摘要算法。

    【讨论】:

      【解决方案2】:

      首先,我认为您应该更多地了解如何查找论文和研究。如果你没有通过谷歌找到任何东西,那是绝对不可能的。无论如何,一些基于提取的文本摘要是:

      1. 易于实现基于词频的方法
      2. 贝叶斯方法
      3. TextRank/LexRank 等基于图表的方法是一个良好的开端。
      4. 集群
      5. 用于总结的模糊系统
      6. 基于神经网络的系统
      7. 我见过基于优化算法的方法
        我建议谷歌搜索这些方法,看看你得到了什么。这些有很多变化,我真的无法判断哪种方法是最好的。记得找到合适的预处理工具。
        祝你好运。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2012-09-08
        • 1970-01-01
        • 2018-01-12
        • 1970-01-01
        • 2013-11-27
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多