【发布时间】:2019-05-06 07:09:22
【问题描述】:
我很难理解如何使用 pyspark 将文件作为库导入。
假设我有以下内容
HappyBirthday.py
def run():
print('Happy Birthday!')
sparky.py
from pyspark import SparkContext, SparkConf
from pyspark.sql import SparkSession
import HappyBirthday
sc = SparkContext(appName="kmeans")
HappyBirthday.run()
sc.stop()
并且它们都存储在 S3 的同一个文件夹中。
我在使用时如何确保这一点
spark-submit --deploy-mode cluster s3://<PATH TO FILE>/sparky.py
,HappyBirthday.py 也导入了?
【问题讨论】:
标签: pyspark amazon-emr