【发布时间】:2020-04-01 22:30:53
【问题描述】:
我有一个格式如下的表格:
A B C D
7 7 2 12
2 2 3 4
2 2 2 4
2 2 2 3
5 5 2 7
我想使用内置相关函数 (https://prestodb.io/docs/current/functions/aggregate.html corr(y, x) → double) 计算每列之间的相关性
我可以遍历所有列并每次执行 corr 计算:
select corr(A,B) from table
但我想减少访问 presto 的次数,并尽可能在一个查询中运行它。
是否有可能获得超过某个阈值的列名,或者至少是一个查询中所有可能组合之间的相关分数?
谢谢。
【问题讨论】:
-
相关性涉及两个系列的数据(这里是两列)。您将如何定义每列之间的相关性?
-
也许我应该澄清一下,我想在一个查询中获取所有列组合之间的相关矩阵(A 与 B、A 与 C、A 与 D、B 与 C 等)
标签: sql hive presto amazon-athena