【发布时间】:2020-05-29 22:18:22
【问题描述】:
我正在使用 Huggingface 的 transformers 库并希望使用 BERT 执行 NER。我试图找到一个明确的示例,说明如何使用 BERT 正确格式化 NER 的数据。从论文和我发现的 cmets 中我并不完全清楚。
假设我们有以下句子和标签:
sent = "John Johanson lives in Ramat Gan."
labels = ['B-PER', 'I-PER', 'O', 'O', 'B-LOC', 'I-LOC']
我们输入到模型中的数据会是这样的吗:
sent = ['[CLS]', 'john', 'johan', '##son', 'lives', 'in', 'ramat', 'gan', '.', '[SEP]']
labels = ['O', 'B-PER', 'I-PER', 'I-PER', 'O', 'O', 'B-LOC', 'I-LOC', 'O', 'O']
attention_mask = [0, 1, 1, 1, 1, 1, 1, 1, 1, 0]
sentence_id = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0]
?
谢谢!
【问题讨论】:
-
这看起来不错。
标签: python nlp format bert-language-model huggingface-transformers