【发布时间】:2019-07-04 01:03:07
【问题描述】:
我正在分析推特数据,并希望提取推文中的所有主题标签。我曾经像这样提取主题标签:
tweet = 'I like #apple #orange'
str_extract_all(tweet,"#\\S+")
这适用于大多数情况。但有时两个主题标签彼此相邻。
tweet = 'I like #apple#orange'
str_extract_all(tweet,"#\\S+")
我得到的是这样的:
[[1]]
[1] "#apple#orange"
有谁知道当主题标签分开或相邻时如何正确提取它们?
【问题讨论】:
-
你能检查你的包版本吗?我无法重现
[1] "#apple" "#orange" -
尝试使用
#[^#\\s]+ -
只需使用
str_extract_all(tweet,"#\\w+")提取示例中的文本。