【发布时间】:2021-12-06 19:43:09
【问题描述】:
我们使用 Airflow 进行作业调度,并调用 Apache Beam 进行 ETL 步骤。数据源是非结构化文件(批处理),需要对其进行解析才能转换为 PCollection。在我看来,两个最好的选择是:
- 向 Airflow DAG 添加预处理节点以解析文件并写入 parquet 文件,然后由 Beam 处理。
- 在 Beam 中编写自定义 IO 连接器以解析非结构化文件并创建 PCollection。
哪个选项更适合 Beam 最佳实践?
【问题讨论】:
标签: python architecture airflow etl apache-beam