【发布时间】:2017-04-05 17:46:01
【问题描述】:
我正在研究用于传感器数据和预测分析的大数据解决方案。 我是大数据的新手,并且已经阅读了 lambda 架构。 我考虑过将 Cassandra 数据库与 Hadoop 一起使用。 Cassandra 是一个高可用性和分区容错性数据库,而 Hadoop hdfs 是一个用于大型分析作业的文件系统。
如果我从物联网设备接收数据,是否应该先将数据保存在 Hadoop 中,然后再保存到 Cassandra? lambda 架构在批处理层有 Hadoop,接收数据并将其发送到服务层到 nosql 数据库。
为什么数据应该在 Hadoop 中排在第一位? 如果 Hadoop 包含原始数据,Cassandra 中存储了哪些数据?
流层目前不在焦点范围内。 我只是想一起了解Cassandra和Hadoop的用法。
Hadoop 中的数据用于大型分析,而 cassandra 中应该有我的 Hadoop 作业的结果。
这是否意味着我可以将原始数据存储在两者中?如果不仅大型分析作业对我的应用程序有用,我可以将我的原始数据存储在 Cassandra 和 Hadoop 中吗?
例子
INSERT INTO temperature(weatherstation_id,event_time,temperature)
VALUES (’1234ABCD’,’2013-04-03 07:02:00′,’73F’);
如果这是我的插入,我在一分钟内就有数千个。 我想做一些使用 Hadoop 的大型工作?
但我也需要我的应用程序的每个数据行,而无需分析。 Cassandra也在存储它?
【问题讨论】:
-
要实时显示给用户的数据需要在 cassandra 中。
-
所以我也可以同时保护我的数据+时间戳?此外,我还可以对大型数据集进行分析并将结果也传递给不同表中的 cassandra?
-
如果我不想对原始数据进行分析,数据如何从 hadoop 传递到 cassandra?还是应该将数据传递给两者?
-
如果您不想进行分析,您可以只将数据存储到 cassandra。稍后您可以根据需要将数据复制到 hadoop
-
是的,以后可以与hadoop集成。如果您的数据会增长,那么您的数据模型必须足以支持这些链接可以帮助您academy.datastax.com/resources/…datastax.com/dev/blog/advanced-time-series-data-modellingstackoverflow.com/questions/30091144/…ebaytechblog.com/2012/07/16/…