【问题标题】:How to remove accents from values in columns?如何从列中的值中删除重音符号?
【发布时间】:2016-10-21 22:17:53
【问题描述】:

如何将特殊字符更改为常用的字母? 这是我的数据框:

In [56]: cities
Out[56]:

Table Code  Country         Year        City        Value       
240         Åland Islands   2014.0      MARIEHAMN   11437.0 1
240         Åland Islands   2010.0      MARIEHAMN   5829.5  1
240         Albania         2011.0      Durrës      113249.0
240         Albania         2011.0      TIRANA      418495.0
240         Albania         2011.0      Durrës      56511.0 

我希望它看起来像这样:

In [56]: cities
Out[56]:

Table Code  Country         Year        City        Value       
240         Aland Islands   2014.0      MARIEHAMN   11437.0 1
240         Aland Islands   2010.0      MARIEHAMN   5829.5  1
240         Albania         2011.0      Durres      113249.0
240         Albania         2011.0      TIRANA      418495.0
240         Albania         2011.0      Durres      56511.0 

【问题讨论】:

标签: python pandas dataframe


【解决方案1】:

这适用于 Python 2.7。要转换为 ASCII,您可能需要尝试:

import unicodedata

unicodedata.normalize('NFKD', u"Durrës Åland Islands").encode('ascii','ignore')
'Durres Aland Islands'

【讨论】:

    【解决方案2】:

    pandas方法是使用向量化的str.normalize结合str.decodestr.encode

    In [60]:
    df['Country'].str.normalize('NFKD').str.encode('ascii', errors='ignore').str.decode('utf-8')
    
    Out[60]:
    0    Aland Islands
    1    Aland Islands
    2          Albania
    3          Albania
    4          Albania
    Name: Country, dtype: object
    

    所以要对所有str dtypes 执行此操作:

    In [64]:
    cols = df.select_dtypes(include=[np.object]).columns
    df[cols] = df[cols].apply(lambda x: x.str.normalize('NFKD').str.encode('ascii', errors='ignore').str.decode('utf-8'))
    df
    
    Out[64]:
       Table Code        Country    Year       City      Value
    0         240  Aland Islands  2014.0  MARIEHAMN  11437.0 1
    1         240  Aland Islands  2010.0  MARIEHAMN  5829.5  1
    2         240        Albania  2011.0     Durres   113249.0
    3         240        Albania  2011.0     TIRANA   418495.0
    4         240        Albania  2011.0     Durres    56511.0
    

    【讨论】:

    • 这应该是选择的答案,问题的正确解决方案。
    【解决方案3】:

    使用此代码:

    df['Country'] = df['Country'].str.replace(u"Å", "A")
    df['City'] = df['City'].str.replace(u"ë", "e")
    

    here!当然你应该对每个特殊字符和每一列都这样做。

    【讨论】:

      【解决方案4】:

      熊猫系列为例

      def remove_accents(a):
          return unidecode.unidecode(a.decode('utf-8'))
      
      df['column'] = df['column'].apply(remove_accents)
      

      在这种情况下解码 asciis

      【讨论】:

        【解决方案5】:

        我想删除所有列名中的所有重音符号,所以我使用了

        df.columns = df.columns.str.normalize('NFKD').str.encode('ascii',errors='ignore').str.decode('utf-8')
        

        【讨论】:

          猜你喜欢
          • 2010-09-19
          • 2012-12-10
          • 2015-08-30
          • 2019-01-09
          • 2012-03-30
          • 1970-01-01
          • 2011-12-11
          • 2011-06-16
          相关资源
          最近更新 更多