【问题标题】:Can't remove unicode characters from strings using gsub无法使用 gsub 从字符串中删除 unicode 字符
【发布时间】:2019-01-01 15:54:54
【问题描述】:

我已经查看了许多其他有关如何从字符串中删除 unicode 字符的 stackoverflow 问题/答案,但它们似乎都不适合我!

精确的问题重现:

event = as.data.frame(read_html("https://www.bestfightodds.com/events/ufc-226-miocic-vs-cormier-1447") %>% html_table(fill=T))
event$X5Dimes

如您所见,其中嵌入了向上和向下箭头。我想删除它们,以便只保留该行。例如

"-310<U+25BC>" would become "-310"

我已经尝试了许多 gsub 模式来删除它们——我自己创建的以及其他堆栈溢出答案——但没有任何效果!下面是一些示例模式

event$X5Dimes = gsub("<.+>", "", event$X5Dimes)
event$X5Dimes = gsub("\\S+\\s+|-", "", event$X5Dimes)
event$X5Dimes = gsub("^\\s*<U\\+\\w+>\\s*", "", event$X5Dimes)
event$X5Dimes = gsub("\\<U[^\\>]*\\>", "", event$X5Dimes)  

有人可以帮忙吗?非常感谢——失去理智!谢谢!

【问题讨论】:

  • 您能否提供从问题重现示例中获得的部分来源?
  • 嗯。我以为我是用第一行代码来做的。那不行吗?

标签: r regex unicode gsub


【解决方案1】:

尝试以这种方式简单地做到这一点:

event$X5Dimes = gsub("▼|▲", "", event$X5Dimes)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-07-31
    • 2021-01-28
    • 2018-05-08
    • 2021-03-01
    • 1970-01-01
    • 1970-01-01
    • 2016-08-29
    • 2019-03-14
    相关资源
    最近更新 更多