【问题标题】:Redshift large data load, executing Python functionRedshift大数据加载,执行Python函数
【发布时间】:2016-09-13 09:32:56
【问题描述】:

我在名为 responses 的 Redshift 表中加载了大量数据,其中包含大约 4.5 亿行。在每一行上,我执行一个 Python UDF 来解析用户代理。

我根据列 question_id 设置分布,该列有大约 150 万行。问题是回答在问题之间分布不均

  • 前 10 个 questions_ids 对应于所有响应的大约 60M;
  • 前 20 个 questions_ids 对应于 78M 响应;

当我查看 Redshift 门户时,这会导致一个问题,在执行 Python 函数的查询中,我看到只有一个节点(其中 4 个)在完成大部分工作。

我是否应该将其他内容设置为分布列(设置 question_id 完全适合我未来的查询需求)?

有没有办法解决这个问题?

【问题讨论】:

    标签: amazon-redshift


    【解决方案1】:

    啊,我发现了问题,我从中读取数据并应用解析的表分布错误,将所有数据保存在一个切片中,这就是解析速度慢的原因,并且只有一个节点在工作。

    【讨论】:

      猜你喜欢
      • 2019-06-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-10-26
      • 2016-05-22
      相关资源
      最近更新 更多