【问题标题】:Automatic keywords extraction(AKE) from a set of documents?从一组文档中自动提取关键字(AKE)?
【发布时间】:2016-05-06 06:02:56
【问题描述】:

许多算法都是关于从单个文档中提取的。但是我想知道如何从一组文档中提取关键字(或特征词),它们可以代表这组文档的特征?一次放入所有文档进行分析可能过于昂贵。是否有某种算法可以一次处理一个文档,然后完全组合/计算结果以生成这组文档的关键字?

【问题讨论】:

  • 如果您最终将结果完全合并,为什么不预先处理所有文档?听起来您正在寻找主题建模
  • 请更具体。你用什么工具等等...

标签: nlp keyword extraction


【解决方案1】:

一种方法是提取关键字(几个商业 API)及其 tf/idf 分数,进行一些清理和规范化。您需要进行一些测试并确定可接受的最低分数阈值,低于该分数的分数,您会丢弃它们不相关的单词 b/c。

【讨论】:

    猜你喜欢
    • 2018-02-02
    • 1970-01-01
    • 1970-01-01
    • 2019-06-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-09-24
    • 1970-01-01
    相关资源
    最近更新 更多