【发布时间】:2019-11-30 05:31:23
【问题描述】:
我有一个包含数千行段落的文本列,我想提取“Capacity > x%”的值。操作符号可以是>,<,=, ~... 我基本上需要操作符号和整数值(例如gsub, grep,grepl, string_extract,等等。没有一个很好的结果。我不确定百分比符号是否在抛出它,或者我只是没有得到代码结构。感谢您的帮助。
以下是我尝试过的一些代码(aa 是 df,TEXT 是 col 名称):
str_extract(string =aa$TEXT, pattern = perl("(?<=LVEF).*(?=%)"))
gsub(".*[Capacity]([^.]+)[%].*", "\\1", aa$TEXT)
genXtract(aa$TEXT, "Capacity", "%")
gsub("%.*$", "%", aa$TEXT)
grep("^Capacity.*%$",aa$TEXT)
【问题讨论】:
-
你能编辑你的问题并提供一个小的reproducible example你的数据集吗?
-
字符向量是否总是相同的字符数?如果是这样,您也许可以使用
substr()
标签: r string filtering text-mining text-extraction