【问题标题】:Match hyphen in combination with new line character匹配连字符与换行符的组合
【发布时间】:2018-11-06 16:22:16
【问题描述】:
import re
string = re.sub(r'-\n', '', string)

我想标记文本中的单词。问题是,所有位于行尾的单词都被错误地标记了。所以我必须在换行符之前删除连字符。

感谢您的帮助!

【问题讨论】:

    标签: python regex nltk tokenize


    【解决方案1】:

    尝试使用前瞻来识别换行符,而不是将其包含在子操作的一部分中:

    string = re.sub(r'-(?=\n)', '', string)
    

    Demo

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-09-25
      • 1970-01-01
      • 2014-02-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多