【发布时间】:2020-12-25 22:32:52
【问题描述】:
我正在处理包含我认为是 unicode 字符的推文语料库,例如 <U+0001F195>, <U+00A0>, <U+0085>, <U+0092>, <U+393C> 等等。它们不遵循相同的模式,有些在句子之间,有些在结尾,有些在开头。有没有办法全部删除?
我发现了许多类似的问题,但它们似乎都不适用于我的情况,或者至少不适用于所有人。 我尝试像这样在 tm_map 中使用 gsub 和 sub:
corpus <- tm_map(corpus, content_transformer(sub), pattern = "<U+00A0>", replacement = '')
但这不起作用。
【问题讨论】:
标签: r