【发布时间】:2016-02-13 09:31:02
【问题描述】:
我想在 Spark SQL 中创建一个自定义的基于正则表达式的 UDF。我的偏好是创建一个内存驻留
Map[String,Pattern]
其中 Pattern 指的是字符串键的编译正则表达式版本。但要做到这一点,我们需要将地图创建放入 UDF 的“初始化”函数中。
那么 Spark udf 是否有任何结构支持跨调用的持久状态(通过 Spark SQL)?
请注意,HIVE 确实支持 UDF 的生命周期。我用它来生成解析树作为初始化的一部分,以便 UDF 的实际调用针对闪电般快速的树,而不涉及解析。
【问题讨论】:
标签: scala apache-spark apache-spark-sql user-defined-functions