【发布时间】:2018-07-11 08:54:54
【问题描述】:
我正在通过 parquet 文件将大量数据读入数据帧。我注意到大量的列要么有 1,0,-1 作为值,因此可以从 Ints 转换为 Byte 类型以节省内存。
我为此编写了一个函数并返回一个新的数据帧,其中的值转换为字节,但是当在 UI 中查看数据帧的内存时,我发现它只是保存为原始数据帧的转换,而不是作为一个新的数据帧本身,因此占用相同数量的内存。
我对 Spark 比较陌生,可能不完全了解其内部结构,那么我将如何开始将这些列设置为 ByteType?
【问题讨论】:
-
你能分享你的代码吗?
-
您在转换后是否执行了一些操作(如
count、first等)?
标签: python apache-spark pyspark spark-dataframe