【发布时间】:2019-08-10 01:48:49
【问题描述】:
我是机器学习(命名实体识别)的新手,我被分配了一项任务,在数百个段落中手动标记我的数据,以重新训练双向 LSTM 模型。有没有更好的方法,或者我必须浏览整个内容并手动标记每个组织、人员?
【问题讨论】:
标签: machine-learning nlp lstm named-entity-recognition
我是机器学习(命名实体识别)的新手,我被分配了一项任务,在数百个段落中手动标记我的数据,以重新训练双向 LSTM 模型。有没有更好的方法,或者我必须浏览整个内容并手动标记每个组织、人员?
【问题讨论】:
标签: machine-learning nlp lstm named-entity-recognition
我不太确定我是否理解了这个问题,但你不必阅读整个语料库。只需将整个语料库组合成一组单词,浏览该组,然后找到任何实体。您将需要小心处理文本的方式(例如,不能小写所有内容 b.c. 然后 Apple -> apple 并且您会错过该实体)。有些软件包会附带一些已经识别的实体(例如 SpaCy 已经识别 NATO),但您的语料库可能会有一些特定的实体(这取决于语料库和您使用的软件)。
【讨论】:
您的问题没有是或否的答案。我想你需要使用某种无监督的方法来准备你的监督数据集。
TextRank 可能对您非常有用。
否则我会建议(在您进行通常的预处理之后,例如小写、标点符号删除等)应用 word2vec(或任何类型的词向量化),然后应用某种类型的聚类,如 K-means 甚至更好DBSCAN。
通过这种方式,您将能够在视觉上分离数据集中的“主题/主题”,然后有一个简单的脚本来标记它们。
希望这是有道理的,并且会有所帮助。
【讨论】: