【发布时间】:2018-06-10 02:33:22
【问题描述】:
我想在Windows 7 via cmd 中使用最新的Apache Spark Version i.e 2.2.1 读取CSV 文件,但由于metastore_db 存在问题而无法这样做。我尝试了以下步骤:
1. spark-shell --packages com.databricks:spark-csv_2.11:1.5.0 //Since my scala
// version is 2.11
2. val df = spark.read.format("csv").option("header", "true").option("mode", "DROPMALFORMED").load("file:///D:/ResourceData.csv")// As //in latest versions we use SparkSession variable i.e spark instead of //sqlContext variable
但它抛出了以下错误:
Caused by: org.apache.derby.iapi.error.StandardException: Failed to start database 'metastore_db' with class loader o
.spark.sql.hive.client.IsolatedClientLoader
Caused by: org.apache.derby.iapi.error.StandardException: Another instance of Derby may have already booted the database
我可以在 1.6 版本中读取 csv,但我想在最新版本中读取。谁能帮我这个??我被困了很多天。
【问题讨论】:
-
您是否有任何其他 Spark 应用程序(包括
spark-shell)正在运行?您可以编辑您的问题并添加整个堆栈跟踪吗? -
我没有运行任何其他 spark 应用程序,并且它的堆栈跟踪很长。我不能把它放在这里,所以我只是从堆栈跟踪中找出了主要原因行
-
顺便说一句,您不需要
com.databricks:spark-csv_2.11:1.5.0,因为它已经是 Spark 2.x 的一部分。删除它以减少后顾之忧。 -
尝试不使用 databricks 包,但仍然出现相同的错误。我已更新我的问题 如果需要任何其他信息,请告诉我。
标签: scala csv apache-spark apache-spark-sql