【发布时间】:2018-09-09 19:06:30
【问题描述】:
我想将 Spark DataFrame 从 AWS SageMaker 保存到 S3。在笔记本中,我跑了
myDF.write.mode('overwrite').parquet("s3a://my-bucket/dir/dir2/")
我明白了
Py4JJavaError:调用 o326.parquet 时出错。 : java.lang.RuntimeException:java.lang.ClassNotFoundException:类 org.apache.hadoop.fs.s3native.NativeS3FileSystem 未找到 org.apache.hadoop.conf.Configuration.getClass(Configuration.java:2195) 在 org.apache.hadoop.fs.FileSystem.getFileSystemClass(FileSystem.java:2654) 在 org.apache.hadoop.fs.FileSystem.createFileSystem(FileSystem.java:2667) 在 org.apache.hadoop.fs.FileSystem.access$200(FileSystem.java:94) 在 org.apache.hadoop.fs.FileSystem$Cache.getInternal(FileSystem.java:2703) 在 org.apache.hadoop.fs.FileSystem$Cache.get(FileSystem.java:2685) 在 org.apache.hadoop.fs.FileSystem.get(FileSystem.java:373) 在 org.apache.hadoop.fs.Path.getFileSystem(Path.java:295) 在 org.apache.spark.sql.execution.datasources.DataSource.writeInFileFormat(DataSource.scala:394) 在 org.apache.spark.sql.execution.datasources.DataSource.write(DataSource.scala:471) 在 org.apache.spark.sql.execution.datasources.SaveIntoDataSourceCommand.run(SaveIntoDataSourceCommand.scala:50) 在 org.apache.spark.sql.execution.command.ExecutedCommandExec.sideEffectResult$lzycompute(commands.scala:58) 在 org.apache.spark.sql.execution.command.ExecutedCommandExec.sideEffectResult(commands.scala:56) 在 org.apache.spark.sql.execution.command.ExecutedCommandExec.doExecute(commands.scala:74) 在 org.apache.spark.sql.execution.SparkPlan$$anonfun$execute$1.apply(SparkPlan.scala:117) 在 org.apache.spark.sql.execution.SparkPlan$$anonfun$execute$1.apply(SparkPlan.scala:117) 在 org.apache.spark.sql.execution.SparkPlan$$anonfun$executeQuery$1.apply(SparkPlan.scala:138) 在 org.apache.spark.rdd.RDDOperationScope$.withScope(RDDOperationScope.scala:151) 在 org.apache.spark.sql.execution.SparkPlan.executeQuery(SparkPlan.scala:135) 在 org.apache.spark.sql.execution.SparkPlan.execute(SparkPlan.scala:116) 在 org.apache.spark.sql.execution.QueryExecution.toRdd$lzycompute(QueryExecution.scala:92) 在 org.apache.spark.sql.execution.QueryExecution.toRdd(QueryExecution.scala:92) 在 org.apache.spark.sql.DataFrameWriter.runCommand(DataFrameWriter.scala:609) 在 org.apache.spark.sql.DataFrameWriter.save(DataFrameWriter.scala:233) 在 org.apache.spark.sql.DataFrameWriter.save(DataFrameWriter.scala:217) 在 org.apache.spark.sql.DataFrameWriter.parquet(DataFrameWriter.scala:508) 在 sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method) 在 sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:62) 在 sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43) 在 java.lang.reflect.Method.invoke(Method.java:498) 在 py4j.reflection.MethodInvoker.invoke(MethodInvoker.java:244) 在 py4j.reflection.ReflectionEngine.invoke(ReflectionEngine.java:357) 在 py4j.Gateway.invoke(Gateway.java:280) 在 py4j.commands.AbstractCommand.invokeMethod(AbstractCommand.java:132) 在 py4j.commands.CallCommand.execute(CallCommand.java:79) 在 py4j.GatewayConnection.run(GatewayConnection.java:214) 在 java.lang.Thread.run(Thread.java:745) 原因: java.lang.ClassNotFoundException:类 org.apache.hadoop.fs.s3native.NativeS3FileSystem 未找到 org.apache.hadoop.conf.Configuration.getClassByName(Configuration.java:2101) 在 org.apache.hadoop.conf.Configuration.getClass(Configuration.java:2193)
我应该如何在 Notebook 中正确操作?非常感谢!
【问题讨论】:
标签: amazon-web-services apache-spark hadoop amazon-s3 amazon-sagemaker