【问题标题】:Distributed, error-handling, copying of TB's of dataTB 级数据的分布式、错误处理、复制
【发布时间】:2011-04-21 16:52:13
【问题描述】:

我们有一个每天存储数 TB 数据 (10-20TB) 的盒子,其中驱动器上的每个文件从兆字节到千兆字节不等。

我们希望将所有这些文件发送到一组“披萨盒”,它们将在那里消费和处理文件。

除了 distcp (hadoop) 之外,我似乎找不到任何可以处理这种数据量的东西。 Robocopy/etc 不行。

有人知道可以处理这种类型的委派(在披萨盒之间共享工作)并具有可靠文件传输的解决方案吗?

【问题讨论】:

  • 您的问题不清楚且不完整。您是否拥有每天处理 20TB 的网络?您提到了 Hadoop 并用 Hadoop 标记了这个问题。为什么 Hadoop 不是您问题的答案?

标签: networking copy hadoop distributed


【解决方案1】:

看看 Flume http://archive.cloudera.com/cdh/3/flume/UserGuide.html

Flume 是一种分布式、可靠且可用的服务,用于高效收集、聚合和移动大量日志数据。它具有基于流数据流的简单灵活的架构。它具有可调整的可靠性机制以及许多故障转移和恢复机制,具有健壮性和容错性。系统集中管理,实现智能动态管理。它使用一个简单的可扩展数据模型,允许在线分析应用程序。

安装它https://wiki.cloudera.com/display/DOC/Flume+Installation

【讨论】:

    【解决方案2】:

    正如已经提到的,Hadoop 就是答案,因为它正是为此类大数据而设计的。您可以创建 Hadoop 集群并将信息存储在那里,并使用盒子的核心通过 map/reduce 分析信息。

    【讨论】:

      猜你喜欢
      • 2018-06-18
      • 2012-10-10
      • 2017-11-22
      • 1970-01-01
      • 1970-01-01
      • 2011-08-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多