【发布时间】:2022-10-07 18:33:53
【问题描述】:
我有一个带有如下列的 Pandas 数据框:
| language |
|---|
| Spanish - C1 |
| No |
| Spanish - B2 |
| Spanish - C1 / German - C1 / Portuguese - C1 |
| No |
| German C2 |
| No |
| Spanish - B2 / Portuguese - C1 |
每个 id 可以没有语言 (\'No\'),它可以有一种语言,后跟它的级别(例如,\'Spanish - B2\'),或者它可以有几种语言,它们的级别用 \"/\ 分隔" 符号(例如 \"Italian-B1 / 葡萄牙语-C2\")。
这个想法是使用来自“语言”列的信息在新列中进行编码。例如,像这样:
| id | no_lang | Spanish - B2 | Spanish - C1 | German - C1 | German - C2 | Portuguese - C1 |
|---|---|---|---|---|---|---|
| 01 | 0 | 0 | 1 | 0 | 0 | 0 |
| 02 | 1 | 0 | 0 | 0 | 0 | 0 |
| 03 | 0 | 1 | 0 | 0 | 0 | 0 |
| 04 | 0 | 0 | 1 | 1 | 0 | 1 |
| 05 | 1 | 0 | 0 | 0 | 0 | 0 |
| 06 | 0 | 0 | 0 | 0 | 1 | 0 |
| 07 | 1 | 0 | 0 | 0 | 0 | 0 |
| 08 | 0 | 1 | 0 | 0 | 0 | 1 |
如果有多种语言,它们总是按字母顺序出现。
我想这很复杂,我不知道从哪里开始。
提前致谢!任何帮助表示赞赏!