【发布时间】:2020-05-19 13:47:33
【问题描述】:
数据集有 14k 行,有很多标题等。
我是 Pandas 和 Python 的初学者,我想知道如何继续从该数据集中获取名字和姓氏的输出。
数据集:
0 Pr.Doz.Dr. Klaus Semmler Facharzt für Frauenhe...
1 大学博士。 (布达佩斯)Dalia Lax
2 医学博士。约万·斯托吉尔科维奇
3 医学博士。德克施耐德
4 马克·舒尔曼
14083 袋 Kinderarztpraxis
14084 乌尔里希·布罗米格先生
14085 孙海因里希
14086 先生,博士。医学。艾玛迪斯·哈特维希
14087 茉莉莉切
【问题讨论】:
-
数据是如何格式化的?您如何确定某物是名称还是位置/标题/连词/等?名称是手动输入的还是系统结构?
-
是否包含中文名称?因为中文名字是以姓氏开头的。
-
我共享的数据集有两列:索引和一列“标题”。我要清理的字符串中的“标题”。此字符串包含 - 名字、姓氏、头衔(博士、先生、女士等),诸如“/、-、;”之类的字符有些行只有名字和姓氏,但主要是噪音。不确定它是否回答了您的问题
-
不,主要是德国人的名字,但你的观点在这里仍然有效,因为我观察到在某些行中名字和姓氏的顺序是颠倒的。
-
好的,所以“标题”不包含任何结构?如果结构是任意的,那么您无法提取它们的名称,除非您有另一个有效名称列表。
标签: python-3.x pandas jupyter-notebook data-munging data-wrangling