【问题标题】:Manual Tagging of Words for NLP为 NLP 手动标记单词
【发布时间】:2019-08-10 01:48:49
【问题描述】:

我是机器学习(命名实体识别)的新手,我被分配了一项任务,在数百个段落中手动标记我的数据,以重新训练双向 LSTM 模型。有没有更好的方法,或者我必须浏览整个内容并手动标记每个组织、人员?

【问题讨论】:

    标签: machine-learning nlp lstm named-entity-recognition


    【解决方案1】:

    我不太确定我是否理解了这个问题,但你不必阅读整个语料库。只需将整个语料库组合成一组单词,浏览该组,然后找到任何实体。您将需要小心处理文本的方式(例如,不能小写所有内容 b.c. 然后 Apple -> apple 并且您会错过该实体)。有些软件包会附带一些已经识别的实体(例如 SpaCy 已经识别 NATO),但您的语料库可能会有一些特定的实体(这取决于语料库和您使用的软件)。

    【讨论】:

      【解决方案2】:

      您的问题没有是或否的答案。我想你需要使用某种无监督的方法来准备你的监督数据集。

      TextRank 可能对您非常有用。

      否则我会建议(在您进行通常的预处理之后,例如小写、标点符号删除等)应用 word2vec(或任何类型的词向量化),然后应用某种类型的聚类,如 K-means 甚至更好DBSCAN。

      通过这种方式,您将能够在视觉上分离数据集中的“主题/主题”,然后有一个简单的脚本来标记它们。

      希望这是有道理的,并且会有所帮助。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2023-03-30
        • 1970-01-01
        相关资源
        最近更新 更多