【发布时间】:2019-04-18 17:16:55
【问题描述】:
我有大约 20 万个 CSV(都具有相同的架构)。我为他们编写了一个云函数以将它们插入 BigQuery,这样只要我将 CSV 复制到存储桶,就会执行该函数并将数据加载到 BigQuery 数据集
我基本上使用了与文档中相同的代码。
dataset_id = 'my_dataset' # replace with your dataset ID
table_id = 'my_table' # replace with your table ID
table_ref = bigquery_client.dataset(dataset_id).table(table_id)
table = bigquery_client.get_table(table_ref) # API request
def bigquery_csv(data, context):
job_config = bigquery.LoadJobConfig()
job_config.write_disposition = bigquery.WriteDisposition.WRITE_APPEND
job_config.skip_leading_rows = 1
# The source format defaults to CSV, so the line below is optional.
job_config.source_format = bigquery.SourceFormat.CSV
uri = 'gs://{}/{}'.format(data['bucket'], data['name'])
errors = bigquery_client.load_table_from_uri(uri,
table_ref,
job_config=job_config) # API request
logging.info(errors)
#print('Starting job {}'.format(load_job.job_id))
# load_job.result() # Waits for table load to complete.
logging.info('Job finished.')
destination_table = bigquery_client.get_table(table_ref)
logging.info('Loaded {} rows.'.format(destination_table.num_rows))
但是,当我将所有 CSV 复制到存储桶(大约 43 TB)时,并非所有数据都添加到 BigQuery 中,只插入了大约 500 GB。
我不知道出了什么问题。复制作业完成后,Stackdriver Logging 中不会显示任何插入作业,也不会运行任何函数。
【问题讨论】:
标签: google-cloud-platform google-bigquery google-cloud-functions