【发布时间】:2021-10-12 08:44:07
【问题描述】:
我有这个庞大的交易数据集(约 400 000 行)。每笔交易都有source 和destination 帐号。两者中的每一个都包含大约 50 000 个唯一条目。
如何编码这些分类变量?显然,one-hot 编码不是一种选择,因为这甚至需要大约 400GB 的 RAM 才能存储编码的数据集。有没有更好的方法使用更少的 RAM?
【问题讨论】:
标签: pandas scikit-learn cluster-analysis categorical-data one-hot-encoding