【发布时间】:2016-10-20 19:03:02
【问题描述】:
在 Google Bigquery(或类似数据库)中,非规范化数据和不重复数据之间的适当平衡是什么?
例如,我们有带有列的table_1
- 日期
- 值A
- 值 B
另一个table_2 有列
- 日期
- 值 B
- 值 C
table_1 大约比table_2 大 10 000 倍,因此创建包含所有三列的表会复制大量数据。而table_2 用于其他一些情况,所以分开可能是有意义的
感谢您的任何见解
思考这个问题的最佳方式是什么?
【问题讨论】:
-
您是否对这些进行了成本方面的比较?请记住,目前 20 美元等于 BigQuery 上的 1TB 数据。我觉得现在的存储比我们想象的要便宜,只是我们根据需要多次重复使用数据。
-
与其说是成本问题,不如说是数据管理问题。你说得对,现在存储是如此便宜。我担心的是,很难从加载和维护 POV 中管理大量数据。
标签: google-bigquery