【发布时间】:2018-09-18 00:04:19
【问题描述】:
我几天前才开始接触 R,到目前为止,正则表达式本身比我尝试过的任何编程语言都更难,呵呵... 我迫切需要一个,它可以帮助我提取所有字母、数字、美元符号、单引号和双引号的序列(最后两个似乎是问题所在)。 它适用于使用朴素贝叶斯的垃圾邮件预测项目,并且需要区分其中可能包含单引号或双引号的符号序列。 我专门使用 stringr 库中的 str_extract_all 函数,并且在过去两天中必须阅读 50 篇文章,但没有找到什么可以解决我的具体问题,以至于我根本没有时间。 任何帮助都将不胜感激,并将使我在机器学习兴趣方面向前迈出一步。 干杯。
【问题讨论】:
-
请发布一些示例输入和所需的输出。看到你的一两次尝试也很好,这样我们就可以看到你做了什么,不明白什么。
-
一般来说,对于正则表达式,我强烈建议在regex101.com 进行尝试和调试。当您在那里有一个工作正则表达式时,您可以通过将所有反斜杠 \ 加倍来将其从那里移动到 R。
-
而且,对于样本案例,只要覆盖一个合适的范围,只需要 3 或 4 个短样本输入。例如使用
test = c("hello", "hello world", "hello123 wo$rld", "he'll$o!wo\"rl$25\"d", "#@$$123^'as'd"),向我们展示您对该输入的期望输出。