【发布时间】:2019-09-22 16:59:33
【问题描述】:
我需要从数据框行中的单元格中提取制表符分隔的数据
我尝试使用拆分方法,但它不起作用
val df = spark.sql("select _time, _raw, host from logs")
val extractedData = df.filter(
$"host" === "ausflscgap01.us.dell.com" ||
$"host" ==="ausflscgap02.us.dell.com" ||
$"host" === "ausplscgap01.us.dell.com" ||
$"host" === "ausplscgap02.us.dell.com")
.withColumn("splitted", split($"_raw", "\t"))
.select($"splitted".getItem(5)
.alias("pctIdle"))
.show()
行中的实际数据:
CPU pctUser pctNice pctSystem pctIowait pctIdle
all 9.55 0.00 36.18 1.51 52.76
0 10.00 0.00 37.00 4.00 49.00
1 9.00 0.00 34.00 0.00 57.00
我只需要为“所有”行提取 pctIdle 列 预期输出
pctIdle
52.76
【问题讨论】:
标签: scala apache-spark apache-spark-sql