【发布时间】:2020-10-19 16:31:38
【问题描述】:
我正在处理使用 prestodb 作为查询引擎和 Hive 作为元存储与外部存储链接的大型数据集。以下是我的场景的详细信息:
我有一个包含时间序列数据(时间戳)和一个数字列的数据集。我想使用插值技术填充缺失值。例如 输入数据集:
执行操作后输出应如下所示:
一个更简单的解决方案是使用 pandas 并插入所有值,但在内存中加载数百万行并不是一个好方法。同样presto不支持分页。
实现上述场景的最佳方法是什么?
【问题讨论】:
标签: sql pandas interpolation presto