【发布时间】:2021-02-09 14:04:41
【问题描述】:
我有一个由 1245 行组成的数据框“df1”,包含一列文本(对象类型)和主题(对象类型)。主题列包含与文本标签对应的不同数字。 这是一个例子:
text topic
1207 June 2019: The French Facility for Global Envi... 3 12 7
1208 May 2019: Participants from multi-stakeholder ... 8
1209 2 July 2019: UN Member States have reached agr... 1 7
1210 30 June 2019: The G20 Leaders’ Summit and asso... 7 8 9 11 12 13 14 15 17
我想获得一个这样的热编码形式(也在列名中的数字前添加一个“S”):
text S1 S2 S3 ..... S7 S8 S9 etc.
1207 June 2019: The French Facility for Global Envi... 0 0 1 ..... 1 0 0
1208 May 2019: Participants from multi-stakeholder ... 0 0 0 ...... 0 1 0
1209 2 July 2019: UN Member States have reached agr... 1 0 0 ..... 1 0 0
1210 30 June 2019: The G20 Leaders’ Summit and asso... 0 0 0 ......1 1 1
这里的“困难”是我的文本是多标签的,所以简单的 one-hot-encoding 的代码不适用于我的情况。 有什么想法吗?
【问题讨论】:
-
您是否期待 Python 中的答案(问题上的标签)。您尝试过的代码是一个 R 库
-
确实,我只用python。我现在知道为什么这段代码不起作用了……
标签: python dataframe data-cleaning one-hot-encoding