【发布时间】:2022-01-08 01:37:58
【问题描述】:
这是可重现的例子。
df2 <- data.frame(Num = c(1,2,3), Comment = c('nick comment12021.12.01 nickn comment2222021.12.02 nickname333 commennnnt222021.12.01', 'nick comment12021.12.01 nickn comment2222021.12.02 nickname333 commeeeent222021.12.01','nick comment12021.12.01 nickn comment2222021.12.02 nickname3333333 comment22021.12.01') )
Num Comment
----------------------------------------------------------------------------
1 Tom comment1~ Jay comment2 Yun comment 3 ~
2 Tim comment1~ Cristal comment2~ Lomio comment3~
3 Tracer comment1~ Teemo comment2~ Irelia comment3~
--------------------------------------------------------------------------
我有一个包含 2 列和多行的数据框。 这些是我通过爬取网站获得的 cmets。但是,由于它是一个非常有活力的网站,我只好一次获得多个人的昵称和 cmets。
我想从这段不规则的文本中删除昵称,并创建一个只有 cmets 的词云。但我想不出只删除昵称的方法。 昵称和cmets的长度是不规则的,所以我不能按照我知道的方式去做。
【问题讨论】:
-
数据中是否有任何额外的分隔符或结构,例如所有内容都放在 " 或者可能是来自抓取的一些标签。如果您没有这些额外的分隔符,可能无法实现您的目标正在寻找。如果可能,您能否分享数据的摘录或模拟一些数据。
-
@David 是的,它有分隔符 ' ' 七个空格键。例如,“昵称'七个空格'comment12021.12.01'七个空格'Nickname2'七个空格'comment22021.12.01'七个空格'Nickname3'七个空格'comment32021.12.01”
-
@Daivd 我添加了可重现的示例。
-
请注意,您的评论列并不总是由七个空格分隔,您可能需要将正则表达式减少到
" {3}"或类似的东西。
标签: r dataframe web-crawler