【发布时间】:2016-01-03 19:23:12
【问题描述】:
当 .csv 标头和表架构都未定义时,将 PCollection<TableRow> 导出为 BigQuery 表或 .csv 文件的最佳方式是什么?
它们是未知的,因为PCollection<TableRow> 是BigQueryIO.Read 查询的结果(不返回架构),但是,可以从查询中使用的字符串解析结果表行的列名(解决方法)。
例子:
String query = "SELECT nationality, COUNT(DISTINCT personID) AS population
FROM Dataset.Table
GROUP BY nationality";
PCollection<TableRow> result = p.apply(BigQueryIO.Read.fromQuery(query));
我想做的是制作一个自动导出 .csv 或表格的函数,而无需为每个查询结果手动定义架构或 .csv 标头。
有什么建议吗?提前致谢!
【问题讨论】:
-
在这里stackoverflow.com/questions/34518795/… 提出了类似的问题,但建议的解决方案将处理的数据量加倍,这是不受欢迎的
标签: java csv google-bigquery google-cloud-dataflow