【发布时间】:2018-06-20 03:16:24
【问题描述】:
我正在运行 PySpark 应用程序:
- emr-5.8.0
- Hadoop 发行版:Amazon 2.7.3
- Spark 2.2.0
我在一个非常大的集群上运行。该应用程序从 s3 读取一些输入文件。其中之一被加载到内存中并广播到所有节点。另一个使用 SparkFiles 功能分发到集群中每个节点的磁盘。该应用程序可以工作,但性能比大型作业的预期慢。查看日志文件,我看到以下警告几乎不断重复:
WARN S3AbortableInputStream: Not all bytes were read from the S3ObjectInputStream, aborting HTTP connection. This is likely an error and may result in sub-optimal behavior. Request only the bytes you need via a ranged GET or drain the input stream after use.
这往往发生在有关访问已加载到内存并广播的文件的消息之后。这个警告是要警告的吗?如何避免?
Google 搜索显示了几个人在本地 Hadoop 应用程序中处理此警告,但我在 Spark 或 PySpark 中没有发现任何相关信息,并且无法弄清楚这些解决方案将如何适用于我。
谢谢!
【问题讨论】:
标签: hadoop apache-spark pyspark hdfs