【问题标题】:Can I identify intranet page content using Named Entity Recognition?我可以使用命名实体识别来识别 Intranet 页面内容吗?
【发布时间】:2011-04-29 10:38:31
【问题描述】:

我是自然语言处理的新手,我想通过创建一个简单的项目来了解更多信息。 NLTK 被建议在 NLP 中流行,所以我将在我的项目中使用它。

这是我想做的:

  • 我要扫描我们公司的内网页面;大约 3000 页
  • 我想根据某些标准解析和分类这些页面的内容,例如:人力资源、工程、公司页面等...

从我目前阅读的内容来看,我可以使用命名实体识别来做到这一点。我可以为每个页面类别描述实体,训练 NLTK 解决方案并运行每个页面以确定类别。

这是正确的方法吗?我感谢任何方向和想法...

谢谢

【问题讨论】:

    标签: nlp nltk


    【解决方案1】:

    看起来你想做text/document classification,这与命名实体识别不太一样,它的目标是识别文本中的任何命名实体(专有名称、地点、机构等)。但是,在有限域中进行文本分类时,专有名称可能是非常好的功能,例如,带有首席工程师姓名的页面可能会被分类为 Engineering。

    NLTK 书有a chapter on basic text classification

    【讨论】:

    • 如果我想对“结构工程”或“电气工程”等更深入的“工程”页面进行分类怎么办?那么我必须识别每个工程学科的一些正则表达式模式。你的例子也是一个很好的。如果没有正则表达式不匹配特定学科,可能是主题文本中的工程师名称(属于已知学科)可以指示特定学科。NLP中的NER是否有助于实现这一目标?
    • 通常你会训练某种基于向量的模型,通常基于 tf/idf 权重,这在实践中和理论上都不是很难,通常可以得到很好的结果。如果这还不够,确实存在更高级的方法。我认为NER没有多大用处,自己创建正则表达式来对文档进行分类也没有多大用处,这很可能是很多工作,尤其是。如果您想要细粒度的类别,并且在处理更困难的文档时,您将不得不自己发明某种置信度分数。
    • 我明白你的意思。如何使用 NLTK 执行此操作以及如何开始?你能指出我正确的方向吗?非常感谢您的帮助。
    • 如果你还没有找到它,自然语言处理这本书是了解 NLTK 的一个好的开始:nltk.org/book 它也是开源的。
    • 特别是在 NLTK 书中,有这个部分:nltk.org/book/ch06.html
    猜你喜欢
    • 1970-01-01
    • 2014-03-17
    • 1970-01-01
    • 2011-07-31
    • 2018-03-08
    • 2020-07-02
    • 2014-01-14
    • 2015-06-11
    • 2010-11-04
    相关资源
    最近更新 更多