【发布时间】:2016-06-21 18:16:11
【问题描述】:
我正在使用深度学习对包含 100 个类别的大型数据集进行图像识别。 (与 cifar-100 的大小相比)我现在正在没有 GPU 的单台机器上调整超参数。训练非常缓慢。我想知道是否有任何现有的方法可以在 EC2 Spark 集群上进行培训? 我知道有 SparkNet,但它似乎只支持 Caffe。
【问题讨论】:
-
如果您打算使用 EC2 集群来“调整超参数”,那么为什么不直接在集群中广播 HP,并让每个学习应用程序以个性化的 HP 值运行呢?带有 for 循环和一些 ssh-ing 的批处理脚本应该可以解决问题...
标签: apache-spark amazon-ec2 tensorflow deep-learning