【发布时间】:2020-11-13 16:27:50
【问题描述】:
我认为,这是一个简单的问题,但我似乎找不到使用sep = 使用特殊标点符号来解决separate_rows 的线程。我有一个大型数据框,我在其中使用文本挖掘来提取每个观察中的数据科学术语(N = 2,000)。然后我将该数据作为附加列包含在数据科学解决方案ds_solutions 中。我想将这些术语分开,然后使用group_by 和count = 来查看不同类别是否有任何趋势/模式。
但是,使用sep = ",",我无法删除其他字符[ 和'"',因此我有条目读取为"['forecasting'" 而不仅仅是forecasting 的情况。这是我在分离行之前可以做的事情吗?还是之后?提前感谢您的想法!
Project <- c("A", "B", "C")
Stage <- c("Pilot", "Pilot", "Idea")
ds_solutions <- c("['image recognition', 'ai', 'forecast', 'machine learning', 'machine learning model']",
"['clustering', 'sentiment analysis', 'nlp', 'time series']",
"['classifier', 'cluster analysis', 'classification', 'scraping', 'databases']")
sample <- data.frame(Project, Stage, ds_solutions)
Project Stage ds_solutions
A Pilot ['image recognition', 'ai', 'forecast', 'machine learning', 'machine learning model']
B Pilot ['clustering', 'sentiment analysis', 'nlp', 'time series']
C Idea ['classifier', 'cluster analysis', 'classification', 'scraping', 'databases']
【问题讨论】: