【发布时间】:2021-04-17 04:30:00
【问题描述】:
假设我有一个数据集,其中每一行都包含一个句子,该句子源于一个非常大的调查(德语和法语)中的一个开放式问题。大多数句子(答案)都是合乎逻辑的;即有意义的单词组合。但也有少数人粗心大意,随便填了各种不合逻辑的字符串。
一个有用的第一步是识别不是单词的所有内容或以其他方式识别不合逻辑的字符串。是否存在可以促进这一点的软件包?如何解决这个问题?
例子:
df <- structure(list(sentence = c("Das ist ein deutscher Satz.", "Ein kürzerer Satz", "34t34 t444tt", "C'est une sentence francaise", ".-......", "---2r13 1r-2r2")), .Names = c("sentence"), row.names = c(NA,6L), class = "data.frame")
head(df)
sentence
1 Das ist ein deutscher Satz.
2 Ein kürzerer Satz
3 34t34 t444tt
4 C'est une sentence francaise
5 .-......
6 ---2r13 1r-2r2
【问题讨论】: