【发布时间】:2019-09-13 10:20:22
【问题描述】:
我正在尝试解析具有已知结构的 txt.file。 每列代表一个国家,每个值代表该名称在该国家/地区的使用频率。
关于源的更多信息加上原始文档here - 它被称为 nam_dict.txt
看起来像这样:
M Aadam 1 $
F Aadje 1 $
M Ådne + 1 $
M Aadu 12 $
?F Aaf 1 $
F Aafke 4 $
? Aafke 1 $
F Aafkea 1 $
M Aafko 1 $
M Aage 761 $
M Åge + 56 $
F Aagje 1 2 $
问题是数字之间没有分隔符,给定列的任何数字都可能有一个或两个数字(1 到 13)。有什么好的方法可以提取吗?
我想用 Python 和 Pandas 来做这件事。
列如下:
['GreatBritain',
'Ireland',
'U.S.A.',
'Italy',
'Malta',
'Portugal',
'Spain',
'France',
'Belgium',
'Luxembourg',
'theNetherlands',
'EastFrisia',
'Germany',
'Austria',
'Swiss',
'Iceland',
'Denmark',
'Norway',
'Sweden',
'Finland',
'Estonia',
'Latvia',
'Lithuania',
'Poland',
'CzechRepublic',
'Slovakia',
'Hungary',
'Romania',
'Bulgaria',
'BosniaandHerzegovina',
'Croatia',
'Kosovo',
'Macedonia',
'Montenegro',
'Serbia',
'Slovenia',
'Albania',
'Greece',
'Russia',
'Belarus',
'Moldova',
'Ukraine',
'Armenia',
'Azerbaijan',
'Georgia',
'Kazakhstan/Uzbekistan,etc.',
'Turkey',
'Arabia/Persia',
'Israel',
'China',
'India/SriLanka',
'Japan',
'Korea',
'Vietnam',
'othercountries']
希望得到这种类型的输出(适当的数字):
gender GreatBritain Ireland U.S.A. Italy Malta Portugal Spain France Belgium ... Kazakhstan/Uzbekistan,etc. Turkey Arabia/Persia Israel China India/SriLanka Japan Korea Vietnam othercountries
name
Aad M NaN NaN NaN NaN NaN NaN NaN NaN NaN ... NaN NaN NaN NaN NaN NaN NaN NaN NaN NaN
Aadam M NaN NaN NaN NaN NaN NaN NaN NaN NaN ... NaN NaN NaN NaN NaN NaN NaN NaN NaN NaN
Aadje F NaN NaN NaN NaN NaN NaN NaN NaN NaN ... NaN NaN NaN NaN NaN NaN NaN NaN NaN NaN
Ådne M NaN NaN NaN NaN NaN NaN NaN NaN NaN ... NaN NaN NaN NaN NaN NaN NaN NaN NaN NaN
Aadu M NaN NaN NaN NaN NaN NaN NaN NaN NaN ... NaN NaN NaN NaN NaN NaN NaN NaN NaN NaN
【问题讨论】:
标签: python pandas parsing text