【发布时间】:2020-12-04 17:54:40
【问题描述】:
我的问题和this post差不多
我有一个数据框,我需要过滤掉列值不是预定义数组中的子字符串的行。
例如:List = ["apple" , "grapes" , "melon"]
+--------+-----------+
|quantity| fruit|
+--------+-----------+
| 12| apple|
| 24|green apple|
| 6| grapes|
| 11| mango|
| 12| watermelon|
| 15| muskmelon|
| 22| berries|
+--------+-----------+
使用数组过滤后,我的 df 应该是这样的:
+--------+-----------+
|quantity| fruit|
+--------+-----------+
| 12| apple|
| 24|green apple|
| 6| grapes|
| 12| watermelon|
| 15| muskmelon|
+--------+-----------+
应过滤掉列值为“mango”和“berries”的行,因为预定义列表中不存在子字符串。
spark 1.6 有什么建议或想法吗?
【问题讨论】:
标签: scala dataframe apache-spark pyspark user-defined-functions