【问题标题】:Big Data integration testing best practice [closed]大数据集成测试最佳实践 [关闭]
【发布时间】:2016-04-04 13:57:00
【问题描述】:

我正在寻找一些资源,了解基于 AWS 的数据摄取管道的最佳实践,该管道使用 Kafka、storm、spark(流式传输和批处理),使用各种微服务读取和写入 Hbase 以公开数据层。对于我的本地环境,我正在考虑创建允许我与环境交互的 docker 或 vagrant 图像。我的问题变成了如何为更接近产品的功能性端到端环境支持某些东西,死路一条是拥有一个始终在线的环境,但这会变得昂贵。就性能环境而言,沿着相同的思路,似乎我可能不得不下注并拥有可以拥有“世界运行”的服务帐户,但其他帐户将受到计算资源的限制,因此它们不会压倒集群.

我很好奇其他人是如何处理同样的问题的,以及我是否在考虑这个问题。

【问题讨论】:

    标签: apache-spark apache-storm bigdata


    【解决方案1】:

    AWS 还通过 EC2 容器提供 Docker 服务。如果您使用 Docker 镜像在本地部署成功,您可以查看 AWS EC2 容器服务 (https://aws.amazon.com/ecs/)。

    另外,请查看storm-docker (https://github.com/wurstmeister/storm-docker),它提供了易于使用的 docker-files 来部署 Storm 集群。

    【讨论】:

      【解决方案2】:

      试试 hadoop 迷你集群。它支持您使用的大多数工具。

      Mini Cluster

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2013-12-06
        • 1970-01-01
        • 1970-01-01
        • 2021-12-21
        • 1970-01-01
        • 1970-01-01
        • 2010-10-07
        相关资源
        最近更新 更多