【发布时间】:2020-04-14 14:26:08
【问题描述】:
我的文字是这样的
'Laboratories, Inc.'
像这样被标记化
Laboratories TOKEN
, SUFFIX
Inc. SPECIAL-1
但是注解通常不包括后缀字符,如'.'
所以我尝试添加一个后缀规则来标记“。”
(r'[.]+$',)
但它不适用于像 'Inc.' 这样的字符串。或“圣”标记为 SPECIAL-1 问题在于,这样的标记化问题会导致大量注释由于这些错位问题而被忽略,从而显着减少了训练期间有价值的示例。
欢迎提出任何建议。
【问题讨论】:
-
@smci 但方括号代表一个字符类,因此点被视为这样,正则表达式读取“字符串末尾的一个或多个句点字符”,我很确定那是它的作用,你可以在这里自己测试regex101.com
-
erotavlas:对不起,你是对的。在字符类/方括号内,
[.]并不神奇。 (碰巧我最近一直在调试 spaCy 正则表达式和标记化,我对过于宽泛的位感到偏执,比如在[...]之外的点.。)
标签: python tokenize spacy rules