【发布时间】:2019-10-24 21:05:05
【问题描述】:
我是 azure spark/databricks 的新手,并尝试访问特定行,例如数据框中的第 10 行。
这是我到目前为止在笔记本上所做的
1.读取表格中的 CSV 文件
spark.read
.format("csv")
.option("header", "true")
.load("/mnt/training/enb/commonfiles/ramp.csv")
.write
.mode("overwrite")
.saveAsTable("ramp_csv")
2。为“表”ramp_csv 创建一个 DataFrame
val rampDF = spark.read.table("ramp_csv")
3.读取特定行
我在 Scala 中使用以下逻辑
val myRow1st = rampDF.rdd.take(10).last
display(myRow1st)
它应该显示第 10 行,但我收到以下错误
command-2264596624884586:9: error: overloaded method value display with alternatives:
[A](data: Seq[A])(implicit evidence$1: reflect.runtime.universe.TypeTag[A])Unit <and>
(dataset: org.apache.spark.sql.Dataset[_],streamName: String,trigger: org.apache.spark.sql.streaming.Trigger,checkpointLocation: String)Unit <and>
(model: org.apache.spark.ml.classification.DecisionTreeClassificationModel)Unit <and>
(model: org.apache.spark.ml.regression.DecisionTreeRegressionModel)Unit <and>
(model: org.apache.spark.ml.clustering.KMeansModel)Unit <and>
(model: org.apache.spark.mllib.clustering.KMeansModel)Unit <and>
(documentable: com.databricks.dbutils_v1.WithHelpMethods)Unit
cannot be applied to (org.apache.spark.sql.Row)
display(myRow1st)
^
Command took 0.12 seconds --
您能分享一下我在这里缺少的东西吗?我尝试了一些其他的东西,但没有奏效。 提前感谢您的帮助!
【问题讨论】:
标签: scala apache-spark azure-databricks