【问题标题】:Detect / replace utf characters [closed]检测/替换utf字符[关闭]
【发布时间】:2022-01-11 09:03:04
【问题描述】:

我想检测和/或替换奇怪的 utf、非表情符号字符,这些字符会破坏我的标记化管道,例如 \uf0fc,它呈现像一个杯子/玻璃杯:

该图像/代码不包含在我尝试过滤的emojis package 中。

是否有一个类可以描述所有这些字符? 有没有办法可以可靠地检测到它们?

【问题讨论】:

  • 这取决于您的意思是“破坏 my 标记化的非表情符号字符。Unicode 字符被分类为类,“旧表情符号”是符号(但是有很多数学符号). 注意:一些字体/操作系统会将旧的表情符号(所以黑白)替换为更现代的表情符号视图
  • 请求图书馆推荐的部分使这个题外话,但这个问题更根本的问题是不清楚你到底想要实现什么以及你已经尝试过什么。我们不知道您的标记化管道是什么样的,也不知道什么会或不会破坏它。

标签: python text utf-8 nlp


【解决方案1】:

这是来自Private Use Area 的字符。它恰好看起来像你的字体中的啤酒杯,但 Unicode 标准并没有规定这些字体的特定外观或含义;它具有您赋予它的任何含义。这个想法是,你与你正在与之交流的任何人就一个含义达成一致 - 私下里,意思是不涉及 Unicode 联盟。

您可以使用标准的unicodedata 模块来检查字符是否来自Co 类别,或者只是硬编码范围,如here 所述。

【讨论】:

    猜你喜欢
    • 2014-09-22
    • 1970-01-01
    • 2018-09-19
    • 2013-03-08
    • 1970-01-01
    • 2016-06-10
    • 1970-01-01
    • 2012-10-23
    • 1970-01-01
    相关资源
    最近更新 更多