【发布时间】:2011-03-29 17:16:01
【问题描述】:
我有一个高度可并行化的计算密集型项目:基本上,我有一个函数需要在一个大表 (Postgresql) 中的每个观察值上运行。该函数本身是一个存储的 python 过程。
Amazon EC2 似乎非常适合该项目。
我的问题是:我应该制作一个已经包含数据库的自定义图像 (AMI) 吗?这似乎具有最小化数据传输和简化并行化的优点:每个图像都可以获得一些分配的索引块来计算,例如,图像 1 得到 1:100,图像 2 得到 101:200 等。实例(大多数操作指南建议)似乎对我的应用程序没有意义,但我对此很陌生,所以我不相信我的直觉是正确的。
【问题讨论】:
标签: python postgresql amazon-ec2