【问题标题】:Spark Compatible Data Quality Framework for Narrow Data适用于窄数据的 Spark 兼容数据质量框架
【发布时间】:2022-11-11 15:59:21
【问题描述】:

我正在尝试为narrow 格式的大量时间序列数据找到合适的数据质量框架。

对数十亿行数据进行成像,看起来有点像这样:

Sensor Timestamp Value
A 12251 12
B 12262 "A"
A 12261 13
A 12271 13
C 12273 5.4545

有数十万个传感器,但对于每个时间戳只有很小百分比的发送值。

我正在为此数据构建数据质量监控,以检查对值的一些期望(例如,该值是否在给定传感器的预期范围内,有成千上万种不同的期望)。由于数据的大小和现有的基础设施,该解决方案必须在 Spark 上运行。我想在(理想情况下是开源的)数据质量框架上构建这个解决方案,但找不到任何合适的东西。

我研究了 Great Expectations 和 Deequ,但从根本上说,这些似乎是为“宽数据”构建的,其中为列定义了期望。从理论上讲,我可以将我的数据重塑(透视)为这种格式,但这将是一项非常昂贵的操作,并导致一个非常稀疏的表难以使用(或需要按时间采样并以这种方式丢失信息) .

有谁知道这种窄格式时间序列数据的现有(火花兼容)框架?或者可以指出如何在这样的环境中应用 Deequ/Great Expectations 的最佳实践?

【问题讨论】:

    标签: apache-spark data-quality great-expectations amazon-deequ


    【解决方案1】:

    你试过github.com/canimus/cuallee 它是一个开源框架,支持 Observation API 以对数十亿条记录进行测试,速度超快,并且像 pydeequ 一样减少了资源贪婪。直观,易于使用。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-12-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多