【问题标题】:Named Entity Recognition - direct matching with a dictionary命名实体识别 - 与字典直接匹配
【发布时间】:2019-07-03 22:21:13
【问题描述】:

我想使用命名实体识别 (NER) 来识别文本中符合临床概念的单词或短语。

我有一本包含诊断描述及其标签代码的字典。前 2 行示例:

ICD10  ICD10Term
----------------
A00    Cholera
A000   Cholera due to Vibrio cholerae 01, biovar cholerae

首先,我想从直接匹配字典开始,但我不知道该怎么做。我应该只搜索字典是否包含某个字符串吗?还是应该使用包或工具?

我找到了spacy-lookuphttps://github.com/mpuig/spacy-lookup

我不确定如何大规模使用这个包,因为我有很多 txt 文件和字典。

另外,有没有其他的包\工具可以推荐给我?

【问题讨论】:

    标签: python spacy named-entity-recognition


    【解决方案1】:

    您必须先训练自己的 NER 模型才能做到这一点。

    按照 spaCy 的要求准备数据集,然后训练模型。然后您的模型应该能够检测到实体。

    【讨论】:

    • 我不应该使用直接匹配或模糊匹配在我的数据集中找到医学术语吗?一些医学词在一起有不同的含义,所以我认为在找到医学术语之前我不应该进行标记。抱歉,我是这个领域的新手,所以我不确定我所说的是否正确。
    【解决方案2】:

    我会使用 spaCy https://spacy.io/api/cli#pretrainpretrain 函数首先将语言模型更新到您的域。然后从头开始训练 NER - https://spacy.io/usage/training#ner

    【讨论】:

      猜你喜欢
      • 2014-03-17
      • 1970-01-01
      • 1970-01-01
      • 2011-07-31
      • 2018-03-08
      • 2020-07-02
      • 2010-11-04
      • 2021-05-06
      • 2012-09-16
      相关资源
      最近更新 更多