【发布时间】:2015-05-27 10:55:52
【问题描述】:
我刚刚开始使用 spark-cassandra 连接器并遇到以下问题:我有一个数据集,部分位于 cassandra 中,部分位于 HDFS 中(完全相同的架构)。我想创建两个集合的单个 UnionRDD 并从那里继续。
到目前为止我的代码是这样的:
DataFrame df = sqlContext.parquetFile("foo.parquet");
JavaRDD cassandraRDD = (JavaRDD)javaFuntions(sc).cassandraTable("foo_ks","foo_table");
DataFrame cassandraDF = sqlContext.applySchema(cassandraRDD,df.schema());
我收到一个运行时错误,提示无法将 CassandraRow 强制转换为 spark.sql.Row,来自 applySchema 调用......这并不奇怪。什么是让它工作的正确方法? (我的最终目标是联合 df 和 cassandraDF)。
我正在尝试使用 Spark 1.3.1 和 cassandra-spark 的主分支构建。
【问题讨论】:
-
如果遇到异常,则首先打印架构并与 cassandraRDD 的字段进行比较。