【问题标题】:removing Hebrew "niqqud" using r使用 r 删除希伯来语“niqqud”
【发布时间】:2015-12-14 18:07:08
【问题描述】:

一直在努力删除niqqud(用于表示元音或区分希伯来字母表字母的替代发音的变音符号)。 例如,我有这个变量: sample1

我找不到有效的方法来删除字母下方的标志。

试过纵梁,str_replace_all(sample1, "[^[:alnum:]]", "") 试过gsub('[:punct:]','',sample1)

没有成功... :-( 有什么想法吗?

【问题讨论】:

  • 看看my gsub example,对你有用吗?
  • @stribizhev - 非常感谢!它就像一个魅力

标签: regex r text unicode hebrew


【解决方案1】:

您可以使用 \p{M} Unicode 类别将变音符号与类似 Perl 的正则表达式匹配,然后将 gsub 一次性匹配所有这些:

sample1 <- "הֻסְמַק"
gsub("\\p{M}", "", sample1, perl=T)

结果:[1] "הסמק"

demo

\p{M}\p{Mark}:用于与另一个字符组合的字符(例如重音符号、变音符号、封闭框等)。

Regular-Expressions.info, "Unicode Categories"查看更多信息。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-08-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-11-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多