【问题标题】:SequenceFile alternative/extension that allows in-place updates允许就地更新的 SequenceFile 替代/扩展
【发布时间】:2013-06-13 07:55:00
【问题描述】:

我喜欢数据库的便利性,您可以在其中就地更新行。但是 Hadoop 依赖于能够并行使用的序列文件。

我喜欢 HBase 的想法,我可以只重写一行;以及作为 map-reduce 作业的输入。但是 HBase 不是新手必须搞砸的东西,对吧?对此有什么好的工具/方法?

【问题讨论】:

  • HDFS 的设计不支持就地更新。这就是我们需要 HBase 的原因

标签: hadoop hbase


【解决方案1】:

我认为学习和使用 HBase 并不难。

来到你原来的问题。我们使用 HBase 的原因与使用任何其他 DB 的原因相同,即random, real-time read/write access,这是 HDFS 与任何其他 FS 一样缺乏的原因。这适用于任何文件系统,而不仅仅是 HDFS。可以以 ext4 & MySQL 范式为例。

当你说在 HBase 中重写时,它实际上并不是更新。您可以将单元格的new versiondelete 单元格和put 新数据放在同一位置。

您不能说 Hadoop 依赖序列文件来为您提供并行性。并行性是 Hadoop 凭借其性质提供的东西,即distributed platform。您可以使用 Hadoop 处理几乎任何类型的文件,并且具有几乎相同的并行性。序列文件的唯一优点是它们更适合MapReduce processing,因为它们已经在key/vale pairs 中。

你必须接受它,但坦率地说 Hadoop 不理解更新。如果您能详细说明您的用例,也许我可以提出更好的建议。

【讨论】:

    猜你喜欢
    • 2018-04-02
    • 1970-01-01
    • 1970-01-01
    • 2018-06-17
    • 1970-01-01
    • 1970-01-01
    • 2021-04-08
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多