【问题标题】:Hbase vs Cassandra: Which is better for a timeseries data storage?Hbase vs Cassandra:哪个更适合时间序列数据存储?
【发布时间】:2015-01-19 22:04:53
【问题描述】:

我使用我的 API 日志来提取如下信息:

  • 在这段时间内,我的 API 有多少用户?
  • 或者说在这段时间里,什么类型的服务被调用最多?

我提取的几乎所有信息都取决于时间戳。实际上我使用 MongoDB 并将时间戳添加为索引(对于 80GB,索引大小为 12GB)。

建议我迁移到 cassandra 或 Hbase。我想知道哪个更适合我的用例:

  • 时间序列数据分析。
  • 需要良好的写入和读取性能。
  • 可以使用 hadoop 进行数据分析。

感谢您分享您的观点或经验。

【问题讨论】:

    标签: hadoop cassandra hbase analytics bigdata


    【解决方案1】:

    Cassandra 的优点: Cassandra 通常表现出更好的性能(尽管两者都非常出色)。 从操作的角度来看,Cassandra 更容易设置和管理(尽管有一些工具可以帮助您)。

    HBase 的优点: 原生于 hadoop 生态系统

    无论如何,HBase 都需要您安装 hadoop,并且您会得到一个不错的二合一。要使用 Cassandra,您可能需要使用商业非开源产品 DataStax Enterprise,或者调查使用 Spark 进行分析工作,它具有与 Cassandra 的开源连接器。

    【讨论】:

    • 根据您的工作环境,获取 DataStax Enterprise 可能是免费的。
    • 它是用于商业部署,所以它是付费的。但是,当我将 Hadoop 与 Cassandra 一起使用时,Datastax 是否必不可少?
    • 我们正在使用 Apache Spark 和 Apache Cassandra(没有 DataStax Enterprise)。虽然我必须为自动化编写一些初始脚本,但让事情顺利进行非常简单。 DSE 提供 Hadoop / Solr / Spark / etc. 集成 OOB,而您需要自己编写 apache 版本所需的脚本。如果您只需要时间序列分析 + 查询,Spark + Cassandra 不仅可以完成这项工作,而且不需要您设置 Hadoop。
    • 这里是 Spark 与 Hadoop 的另一个讨论:link。如果您正在从事一个未开发项目,我建议您一直使用 spark。甚至 hadoop 供应商也开始分发它。 Spark 本质上是 M/R 的改进版本,具有更低的开销和在 ram 中存储中间数据的能力。
    • 关于 DSE 的问题,使用 Cassandra 和 Hadoop 本质上是用 Cassandra 替换 HDFS。 DSE 为 hive 和 pig 提供访问 Cassandra 表的驱动程序以及称为 CFS 的东西来充当 HDFS 的直接替代品(相同的接口等)。假设您可以编写自己的版本,但我不知道有任何其他产品或项目可以这样做。
    【解决方案2】:

    巧克力或香草冰淇淋 - 哪个更好?

    我建议您成为最佳决策者。为每个选项设置开发环境,这将告诉您更多关于操作和调整问题的信息,我认为这可能是其他任何人都无法提供给您的。 :)

    【讨论】:

      猜你喜欢
      • 2014-07-05
      • 1970-01-01
      • 1970-01-01
      • 2016-07-28
      • 1970-01-01
      • 1970-01-01
      • 2012-05-15
      • 2015-11-17
      • 2013-12-01
      相关资源
      最近更新 更多