【发布时间】:2020-11-23 16:08:45
【问题描述】:
我在airflow 有以下任务,它就像一个魅力:
t = SparkSubmitOperator(
task_id = 'some_id',
application = '/path/to/app.py',
name = 'airflow-spark',
conf = {
'spark.hadoop.fs.s3a.endpoint': 'https://some.url.com/',
'spark.hadoop.fs.s3a.access.key': 'myuser',
'spark.hadoop.fs.s3a.secret.key': 'my_super_secret_password',
},
dag = dag,
)
您可以猜到,我的spark 作业需要在S3 服务器实例上进行身份验证才能检索数据。虽然这可行,但我不想将我的密码作为明文放在dag 中。如何在不使用明文密码的情况下通过S3 服务器进行身份验证?我尝试在airflow 中设置连接,这似乎正好适合这个用例,但是当我在任务中使用conn_id = 'my_connection' 时,它会尝试在服务器上运行 spark 作业。
【问题讨论】: