【发布时间】:2016-09-13 09:32:56
【问题描述】:
我在名为 responses 的 Redshift 表中加载了大量数据,其中包含大约 4.5 亿行。在每一行上,我执行一个 Python UDF 来解析用户代理。
我根据列 question_id 设置分布,该列有大约 150 万行。问题是回答在问题之间分布不均:
- 前 10 个 questions_ids 对应于所有响应的大约 60M;
- 前 20 个 questions_ids 对应于 78M 响应;
当我查看 Redshift 门户时,这会导致一个问题,在执行 Python 函数的查询中,我看到只有一个节点(其中 4 个)在完成大部分工作。
我是否应该将其他内容设置为分布列(设置 question_id 完全适合我未来的查询需求)?
有没有办法解决这个问题?
【问题讨论】:
标签: amazon-redshift