【发布时间】:2019-08-30 20:11:49
【问题描述】:
我期待以下代码; 标记化
this is an example 123
进入
['this', 'is', 'an', 'example 123']
但它看不到单词的数字部分。有什么建议吗?
import re
from nltk.tokenize import RegexpTokenizer
pattern=re.compile(r"[\w\s\d]+")
tokenizer_number=RegexpTokenizer(pattern)
tokenizer_number.tokenize("this is an example 123")
【问题讨论】:
-
改用
split()?