【发布时间】:2020-06-16 18:20:20
【问题描述】:
我想扩展 pyspark.sql.DataFrame 的读/写功能以满足我自己的项目需求。为此,我创建了以下内容
import pyspark.sql
class DataFrame(pyspark.sql.DataFrame):
def __init__(self, *args, **kwargs):
super().__init__(*args, **kwargs)
def write(self, format="parquet", version=True):
if format=="some_format":
# do something
super().write.format(format).save(path)
麻烦的是在代码中我们像这样实例化超类对象data = spark.range(0, 5)
如何将 spark Dataframe 转换为具有最小更改的自定义读/写方法。这可能吗
【问题讨论】:
标签: python pyspark overriding super pyspark-dataframes