【发布时间】:2016-10-15 02:11:59
【问题描述】:
我正在使用 Spark 数据集(Spark 1.6.1 版本)。 下面是我的代码
object App {
val conf = new SparkConf()
.setMaster("local")
.setAppName("SparkETL")
val sc = new SparkContext(conf)
sc.setLogLevel("ERROR")
val sqlContext = new SQLContext(sc);
import sqlContext.implicits._
}
override def readDataTable(tableName:String):DataFrame={
val dataFrame= App.sqlContext.read.jdbc(JDBC_URL, tableName, JDBC_PROP);
return dataFrame;
}
case class Student(stud_id , sname , saddress)
case class Student(classid, stud_id, name)
var tbl_student = JobSqlDAO.readDataTable("tbl_student").filter("stud_id = '" + studId + "'").as[Student].as("tbl_student")
var tbl_class_student = JobSqlDAO.readDataTable("tbl_class_student").as[StudentClass].as("tbl_class_student")
var result = tbl_class_student.joinWith(tbl_student, $"tbl_student.stud_id" === $"tbl_class_student.stud_id").as("ff")
现在我想在多个列上执行 group by 子句?
怎么做?
result.groupBy(_._1._1.created_at)这样可以吗?
如果是,那么我无法将结果视为一个组,如何在多列上执行此操作?
【问题讨论】:
标签: apache-spark dataset apache-spark-dataset