【发布时间】:2019-12-08 07:47:20
【问题描述】:
我觉得这肯定是在其他地方问过的,但尽我所能,我在这里或网上其他地方都没有找到类似的问题。
在 Python 中,当我清理一个长文本文件并准备好一长串 regex 命令时,我最终看到单字符单词,如 "I" 或 "a",不幸的是被删除。
有没有办法使用regex(或其他)来执行以下操作?
re.sub(r"\non-word-single-character", "", "I want a b c cat")
"I want a cat"
提前致谢。
【问题讨论】:
-
通过消除,a, i, o, u, v 是唯一用于 text-speak (o : Oh!, u : you, v : we) 的字母,除此之外没有其他字母一封信就有意义,对吧?
-
嗯,我想必须使用一个全面的映射,这将匹配所有可能的非 l33t-speak、非缩短短语并将它们替换为预期的实际单词,并匹配 where solitary字符就是这样,删除那些。我想知道是否有人已经尝试过这样的任务(可能是我想象的某个 nlp 库);我得调查一下。
标签: python regex text data-cleaning