【发布时间】:2020-09-24 06:29:21
【问题描述】:
我正在对简历数据集进行命名实体识别,我们有日期、电话、电子邮件等实体,
我正在研究如何预处理这些实体。我目前正在像这样在每个标点符号后添加一个空格,
DAVID B-Name
John I-Name
, O
IT O
Washington B-Address
, I-Address
DC I-Address
( B-Phone
107 I-Phone
) I-Phone
155
- I-Phone
4838 I-Phone
david B-Email
. I-Email
John I-Email
@ I-Email
gmail I-Email
. I-Email
com I-Email
但我开始质疑在推理过程中如何处理此类文本的过程。我假设即使在推断时我们也必须使用在每个标点符号后添加空格的相同过程来预处理文本,不是吗?
但它不会那么可读吧?
例如,在推理时,我必须提供像 test @ example . com? 这样不可读的输入文本,不是吗?它只能预测这种格式的实体。
【问题讨论】:
标签: deep-learning nlp named-entity-recognition