【发布时间】:2016-04-04 13:57:00
【问题描述】:
我正在寻找一些资源,了解基于 AWS 的数据摄取管道的最佳实践,该管道使用 Kafka、storm、spark(流式传输和批处理),使用各种微服务读取和写入 Hbase 以公开数据层。对于我的本地环境,我正在考虑创建允许我与环境交互的 docker 或 vagrant 图像。我的问题变成了如何为更接近产品的功能性端到端环境支持某些东西,死路一条是拥有一个始终在线的环境,但这会变得昂贵。就性能环境而言,沿着相同的思路,似乎我可能不得不下注并拥有可以拥有“世界运行”的服务帐户,但其他帐户将受到计算资源的限制,因此它们不会压倒集群.
我很好奇其他人是如何处理同样的问题的,以及我是否在考虑这个问题。
【问题讨论】:
标签: apache-spark apache-storm bigdata