【发布时间】:2018-10-24 19:55:02
【问题描述】:
我有一个 Pandas 列,其中主要包含整数、一些浮点数和一些字符串,如“是”、“否”和一些其他字符串。我可以用什么替换这些字符串?由于该列不是完全分类的,因此我无法进行一般的热编码或类似操作。这种情况下的最佳做法是什么?
更新: 由于某种原因,此列的外观并不明显,因此这里是一个示例:
column_name
1000
45
3.0
yes
no
340.0
p
k
4
.
.
.
数据是完全组成的,我唯一需要知道在列中处理此类字符串的最佳实践是什么。
【问题讨论】:
-
如果您能提供更多上下文,将会很有帮助!你想做什么?它是什么样的数据?您能否提供数据的示例/视图?
-
这个问题再清楚不过了,但我添加了一个更新。
-
你想用这个实现什么?如果你愿意,你可以将字符串转换为数字,如果这有意义的话,比如“是”可以是 1,“否”是 0,但显然这不是熊猫问题,而是数据问题:字符串是什么意思?你想对输出做什么?如果您说的是 NLP 类型的东西,那么您需要使用 Word2Vec 之类的东西将字符串编码为向量。对于像“是/否”这样的简单字符串映射,二进制映射 1/0 听起来非常好。对于其他字符串,好吧,如果没有上下文的含义,很难提供帮助。
-
我提出的
get_dummies函数是一种通用的方法,可以将分类数据转换为用于ML类型任务的数字。
标签: python-3.x pandas data-science