【发布时间】:2022-11-26 00:06:36
【问题描述】:
我有一个数据框,其中包含一列 ['locality_name'],其中包含村庄、城镇、城市的名称。有些名字写成“汉密尔顿镇”,有些像“汉密尔顿”,有些像“汉密尔顿市”等。因此,很难计算唯一值等。我的目标是只留下名字。
我想编写一个函数,删除字符串的一部分直到大写字母,然后将其应用于我的数据框。
那就是我试过的:
重新进口
def my_slicer(行): """ 返回带有地区名称的字符串 """ return re.sub('ABCDEFGHIKLMNOPQRSTVXYZ','', row['locality_name'])
raw_data['locality_name_only'] = raw_data.apply(my_slicer, axis=1)
我希望它返回一个包含地名的新列。相反,没有任何改变 - ['locality_name_only'] 与 ['locality_name'] 具有相同的值。
【问题讨论】: