【问题标题】:how to fix ''nothing to repeat at position 2'' [duplicate]如何修复''在位置 2 没有重复的内容'' [重复]
【发布时间】:2019-08-19 05:43:53
【问题描述】:

我正在尝试对数据框 tex 中的单词进行词干化

data 是一个数据框,karma 是文本列,zargan 是单词的字典和单词的根

for a in range(1,100000):
    for j in data.KARMA[a].split():
        pattern = r'\b'+j+r'\b' 
        data.KARMA[a] = re.sub(pattern, str(zargan.get(j,j)),data.KARMA[a]) 
print(data.KARMA[1])

我想更改文本中的单词和词根

【问题讨论】:

    标签: python regex stemming lemmatization


    【解决方案1】:

    看起来j 包含一些正则表达式特殊字符,例如*。如果你想让它被解释为文字文本,你可以说

        pattern = r'\b'+re.escape(j)+r'\b'
    

    如果r 应该被类似地强制转换为文字字符串,则可能相同。

    【讨论】:

      猜你喜欢
      • 2013-03-29
      • 1970-01-01
      • 2019-09-26
      • 2016-04-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多