【问题标题】:create dataframe from map in spark java API在 Spark Java API 中从地图创建数据框
【发布时间】:2020-09-13 14:12:14
【问题描述】:

我正在尝试在 java API 中使用 spark sql,下面的简单内容(从官方指南复制:https://spark.apache.org/docs/latest/rdd-programming-guide.html)不会让 intelij 高兴。

它抱怨ClassTag 的东西,我不知道如何创建它或让它自动导入什么的。

        List<Integer> data = Arrays.asList(1, 2, 3, 4, 5);
        JavaRDD<Integer> distData = sc.parallelize(data);

我知道它想使用 3 个参数

public <T> RDD<T> parallelize(final Seq<T> seq, final int numSlices, final ClassTag<T> evidence$1) {

但是我怎样才能得到这个evidence$1 的东西? 官方的例子也没有论据

请帮忙。

【问题讨论】:

    标签: java apache-spark apache-spark-sql


    【解决方案1】:

    我决定查看官方指南附带的示例源代码。 事实证明它需要创建java spark上下文 在我使用了指南源代码中的示例后,我的工作开始了。

    import scala.Tuple2;
    import org.apache.spark.api.java.JavaSparkContext;
    
    List<Tuple2<String, String>> data =
            Arrays.asList(
                    new Tuple2<>("key1","value1")
                    , new Tuple2<>("key2", "value2")
            );
    
    JavaPairRDD<String, String> dataRdd = jsc.parallelizePairs(data);
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-11-03
      • 1970-01-01
      • 2021-03-03
      • 2020-03-22
      • 1970-01-01
      • 2016-11-17
      • 1970-01-01
      • 2020-08-09
      相关资源
      最近更新 更多