【发布时间】:2020-12-10 17:10:58
【问题描述】:
我在 Jupyter Notebook 中使用 PySpark。 我正在尝试使用 2 个数据集进行内部连接:一个有 2455 行,另一个超过 100 万行。为什么内部连接会产生这么多行?当然,它的行数应该少于
print(df.count(),len(df.columns))
19725379 90
print(df1.count(),len(df1.columns))
2455 37
df3 = df.join(df1,"ADDRESS1", "inner")
df3.dropDuplicates(subset=['ADDRESS1']).count
print(df3.count(),len(df3.columns))
603050 126
df3 = df.join(df1,"ADDRESS1", "inner")
print(df3.count(),len(df3.columns))
603050 126
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql inner-join