【问题标题】:Removing <U+????> like in R dataset像 R 数据集中一样删除 <U+????>
【发布时间】:2020-12-25 22:32:52
【问题描述】:

我正在处理包含我认为是 unicode 字符的推文语料库,例如 &lt;U+0001F195&gt;, &lt;U+00A0&gt;, &lt;U+0085&gt;, &lt;U+0092&gt;, &lt;U+393C&gt; 等等。它们不遵循相同的模式,有些在句子之间,有些在结尾,有些在开头。有没有办法全部删除?

我发现了许多类似的问题,但它们似乎都不适用于我的情况,或者至少不适用于所有人。 我尝试像这样在 tm_map 中使用 gsub 和 sub:

corpus <- tm_map(corpus, content_transformer(sub), pattern = "<U+00A0>", replacement = '')

但这不起作用。

【问题讨论】:

    标签: r


    【解决方案1】:
    corpus <- tm_map(corpus, content_transformer(gsub), pattern = '<[^>]+>', replacement = ' ')
    corpus <- tm_map(corpus, content_transformer(gsub), pattern = '<[^>]+><[^>]+>', replacement = ' ')
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-12-25
      • 2017-11-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-01-10
      • 2021-06-21
      相关资源
      最近更新 更多