【发布时间】:2022-11-11 15:59:21
【问题描述】:
我正在尝试为narrow 格式的大量时间序列数据找到合适的数据质量框架。
对数十亿行数据进行成像,看起来有点像这样:
| Sensor | Timestamp | Value |
|---|---|---|
| A | 12251 | 12 |
| B | 12262 | "A" |
| A | 12261 | 13 |
| A | 12271 | 13 |
| C | 12273 | 5.4545 |
有数十万个传感器,但对于每个时间戳只有很小百分比的发送值。
我正在为此数据构建数据质量监控,以检查对值的一些期望(例如,该值是否在给定传感器的预期范围内,有成千上万种不同的期望)。由于数据的大小和现有的基础设施,该解决方案必须在 Spark 上运行。我想在(理想情况下是开源的)数据质量框架上构建这个解决方案,但找不到任何合适的东西。
我研究了 Great Expectations 和 Deequ,但从根本上说,这些似乎是为“宽数据”构建的,其中为列定义了期望。从理论上讲,我可以将我的数据重塑(透视)为这种格式,但这将是一项非常昂贵的操作,并导致一个非常稀疏的表难以使用(或需要按时间采样并以这种方式丢失信息) .
有谁知道这种窄格式时间序列数据的现有(火花兼容)框架?或者可以指出如何在这样的环境中应用 Deequ/Great Expectations 的最佳实践?
【问题讨论】:
标签: apache-spark data-quality great-expectations amazon-deequ