【发布时间】:2017-10-16 01:58:36
【问题描述】:
我的文档中有一些 Unicode 字符串。我想要的只是删除这个 Unicode 代码或用一些空格(“”)替换它。示例=""
doc = "Hello my name is Ruth \u2026! I really like swimming and dancing \ud83c"
如何将其转换为以下内容?
doc = "Hello my name is Ruth! I really like swimming and dancing"
我已经尝试过:https://stackoverflow.com/a/20078869/5505608,但没有任何反应。我正在使用 Python 3。
【问题讨论】:
-
如果您链接的答案不起作用,则说明您没有告诉我们。
-
我已经尝试过
re.sub(r'[^\x00-\x7F]+',' ', text)。代码有效,但没有任何改变@MarkRansom -
这是因为字符串不会就地更新,它们是不可变的。你需要把
re.sub的返回值赋值给text。
标签: python regex python-3.x unicode