【发布时间】:2016-11-01 16:23:31
【问题描述】:
假设您正在从 CSV 文件中读取数百万行数据。每行显示传感器名称、当前传感器值和观察该值时的时间戳。
key, value, timestamp
temp_x, 8°C, 10:52am
temp_x, 25°C, 11:02am
temp_x, 30°C, 11:12am
这与这样的信号有关:
所以我想知道将其存储到 Apache Hadoop HDFS 中的最佳和最有效的方法是什么。第一个想法是使用 BigTable aka HBase。这里信号名称是行键,而值是一个列组,随着时间的推移保存值。可以向该行键添加更多列组(例如实例统计信息)。
另一个想法是使用表格(或类似 SQL)结构。但随后您复制每一行中的密钥。而且您必须按需计算统计数据并将它们单独存储(此处存储到第二个表中)。
不知道有没有更好的办法。存储后,我想在 Python/PySpark 中读取该数据并进行数据分析和机器学习。因此,应该可以使用模式 (Spark RDD) 轻松访问数据。
【问题讨论】:
标签: python hadoop hdfs signal-processing sensors