【发布时间】:2019-04-06 01:03:27
【问题描述】:
我正在解析 PDF 中的表格并尝试清理我的读数。我正在尝试对我的 OCR 中的一些常见故障做一个简单的str_remove_all()。我创建了一个与我的字符串匹配的正则表达式,但是,当我将正则表达式放入 str_remove_all() 时,它失败了。请看下面的代码:
> regexpattern <- '^(\\s*[[:punct:]]*\\s*)+|^\\s*\\d{1,2}\\s*$|^\\s+$|(^\\s*
[[:ascii:]]{1}\\s*$)|(^\\s*[^[:ascii:]]{1}\\s*$)'
> strg <- "Ú"
> grep(regexpattern,strg, perl = T)
[1] 1
> str_remove_all(strg,regexpattern)
[1] "Ú"
关于为什么我的str_remove_all() 失败的任何想法?谢谢!
【问题讨论】:
-
str_remove_all() 需要两个参数,RDocumentation
str_remove_all(string, pattern)。 str_replace_all() 也失败了str_replace_all(strg,regexpattern, "") [1] "Ú"