【发布时间】:2019-04-05 00:17:03
【问题描述】:
鉴于下面的数据框,我想将数字列拆分为数组中原始数字的每个元素 3 个字符的数组
给定数据框:
+---+------------------+
| id| numbers|
+---+------------------+
|742| 000000000|
|744| 000000|
|746|003000000000000000|
+---+------------------+
预期的数据框:
+---+----------------------------------+
| id| numbers |
+---+----------------------------------+
|742| [000, 000, 000] |
|744| [000, 000] |
|746| [003, 000, 000, 000, 000, 000] |
+---+----------------------------------+
我尝试了不同的正则表达式,同时使用下面给出的split 函数和我认为应该在第一次尝试时使用的正则表达式:
import pyspark.sql.functions as f
df = spark.createDataFrame(
[
[742, '000000000'],
[744, '000000'],
[746, '003000000000000000'],
],
["id", "numbers"]
)
df = df.withColumn("numbers", f.split("numbers", "[0-9]{3}"))
df.show()
结果是
+---+--------------+
| id| numbers|
+---+--------------+
|742| [, , , ]|
|744| [, , ]|
|746|[, , , , , , ]|
+---+--------------+
我想了解我做错了什么。是否有可能设置全局标志以获取所有匹配项,或者我完全错过了正则表达式中的某些内容?
【问题讨论】:
标签: python-3.x apache-spark pyspark apache-spark-sql