【发布时间】:2021-02-28 17:54:19
【问题描述】:
我正在尝试创建一个配对的 RDD,其中的键将来自一个 RDD,值都将是 1。
例如,如果有人要导入字符串 "hello world!" 并将其并行化为 RDD,则输出将是:('h', 1), ('e', 1), ('l', 1), ('l', 1),...
到目前为止,我已经写过:
keyRDD = characterRDD.map(lambda x: (x, 1))
这导致(['h', 'e', 'l', 'l', 'o', 'w', 'o', 'r', 'l', 'd,' '!'], 1) 的输出。关闭,但不是我想要的。
我也尝试过使用 for 循环,但在尝试迭代 RDD 时收到错误。
【问题讨论】:
标签: python apache-spark pyspark rdd