【发布时间】:2017-08-14 02:41:21
【问题描述】:
我需要 scikit-learn CountVectorizer 将包含符号“-”的词识别为一个标记词。这是因为我会处理诸如“烹饪时间”之类的标签,这些标签不应一分为二。
我想重点是在 token_pattern 参数中设置正确的正则表达式,但我无法做到这一点。
我正在尝试类似的东西
token_pattern=u'(?u)\b\w\w+(-)?\w+\b'
【问题讨论】:
-
应用此正则表达式后的任何正面和反面例子?
标签: python machine-learning scikit-learn