【发布时间】:2015-12-08 22:02:54
【问题描述】:
我想知道在使用 bdutil 工具部署 Spark 集群时是否有人可以帮助我解决这个问题。 当核心总数增加(>= 1024)时,一直失败,原因如下:
某些机器永远不能 sshable,例如“2015 年 12 月 8 日星期二 13:45:14 PST:'hadoop-w-5' 还不能 sshable (255);正在睡觉”
在部署 spark 工作节点时,某些节点会失败并出现“Exited 100”错误,例如“2015 年 12 月 8 日星期二 15:28:31 PST:退出 100:gcloud --project=cs-bwamem --quiet - -verbosity=info 计算 ssh hadoop-w-6 --command=sudo su -l -c "cd ${PWD} && ./deploy-core-setup.sh" 2>>deploy-core-setup_deploy.stderr 1> >deploy-core-setup_deploy.stdout --ssh-flag=-tt --ssh-flag=-oServerAliveInterval=60 --ssh-flag=-oServerAliveCountMax=3 --ssh-flag=-oConnectTimeout=30 --zone= us-central1-f"
在日志文件中,它说:
hadoop-w-40: ==> deploy-core-setup_deploy.stderr
hadoop-w-40: dpkg-query: package 'openjdk-7-jdk' 未安装且没有可用信息
hadoop-w-40:使用 dpkg --info (= dpkg-deb --info) 检查存档文件,
hadoop-w-40: 和 dpkg --contents (= dpkg-deb --contents) 列出它们的内容。
hadoop-w-40: 无法获取 http://httpredir.debian.org/debian/pool/main/x/xml-core/xml-core_0.13+nmu2_all.deb 从服务器读取错误。远端关闭连接[IP: 128.31.0.66 80]
hadoop-w-40: E: 无法获取一些档案,也许运行 apt-get update 或尝试使用 --fix-missing?
我试过16核128节点、32核64节点、32核32节点等1024核以上的配置,但以上原因1或2都会出现。
我还尝试修改 ssh-flag 以将 ConnectTimeout 更改为 1200s,并更改 bdutil_env.sh 以将轮询间隔设置为 30s、60s、...,它们都不起作用。总会有一些节点失败。
这是我使用的配置之一:
时间 ./bdutil \ --bucket $桶\ - 力量 \ --machine_type n1-highmem-32 \ --master_machine_type n1-highmem-32 \ --num_workers 64 \ --项目$项目\ --upload_files ${JAR_FILE} \ --env_var_files hadoop2_env.sh,extensions/spark/spark_env.sh \ 部署
【问题讨论】:
标签: google-hadoop