【发布时间】:2015-12-19 05:45:35
【问题描述】:
我正在尝试使用 Spark 来计算 Wikipedia XML 转储中锚文本的频率。
输入/输出:
- 输入:锚文本列表
- 输出:(锚文本、频率)对列表
目前的解决方案:
anchor_texts.map(
key => (key, 1)
).reduceByKey {
case (acc, i) => acc + i
}
没有一个作业成功。检查工人日志后,我出现以下错误:
15/12/17 17:28:33 ERROR FileAppender: Error writing stream to file /cs/work/home/hxiao/spark-related/spark-1.5.2-bin-hadoop2.4/work/app-20151217163507-0000/28/stderr
java.io.IOException: Stream closed
at java.io.BufferedInputStream.getBufIfOpen(BufferedInputStream.java:162)
at java.io.BufferedInputStream.read1(BufferedInputStream.java:272)
at java.io.BufferedInputStream.read(BufferedInputStream.java:334)
at java.io.FilterInputStream.read(FilterInputStream.java:107)
at org.apache.spark.util.logging.FileAppender.appendStreamToFile(FileAppender.scala:70)
at org.apache.spark.util.logging.FileAppender$$anon$1$$anonfun$run$1.apply$mcV$sp(FileAppender.scala:39)
at org.apache.spark.util.logging.FileAppender$$anon$1$$anonfun$run$1.apply(FileAppender.scala:39)
at org.apache.spark.util.logging.FileAppender$$anon$1$$anonfun$run$1.apply(FileAppender.scala:39)
at org.apache.spark.util.Utils$.logUncaughtExceptions(Utils.scala:1699)
at org.apache.spark.util.logging.FileAppender$$anon$1.run(FileAppender.scala:38)
我觉得奇怪的是:
在这个阶段之前,我还使用 Spark 收集了从页面标题到页面 id 的映射。一切正常。但是,对于这个阶段,它会崩溃。
一些版本信息:
- 火花:1.5.2
- 斯卡拉:2.10.5
- 模式:集群模式
火花配置:
SPARK_EXECUTOR_MEMORY=8G
SPARK_DRIVER_MEMORY=8G
SPARK_EXECUTOR_CORES=8
我也觉得奇怪的是
如果我在较小的数据集上运行这个程序,一切都会正常。但是,如果放在整个维基百科上,那么上面的错误。
【问题讨论】:
标签: scala apache-spark ioexception