【发布时间】:2021-05-16 21:07:03
【问题描述】:
我有 1 个带有架构的镶木地板数据文件;
- id 整数
- 模型二进制
此文件是使用 pyspark 创建的,包含模型标识符,并使用 pickle python 库模型二进制文件转储。
是否可以为此 parquet 文件创建 Hive 外部表并在 select 命令后获取输出。假设 Hive 外部表具有完全相同的架构。
CREATE EXTERNAL TABLE default.t_model
(
id integer
, model binary
)
STORED AS PARQUET
LOCATION 'hdfs_path';
我已经完成了上述每个步骤,但总是得到空的答案集。我应该使用 Hive UDF 加载二进制列吗?或者我应该为 parquet 二进制列尝试另一种数据类型,如数组?
感谢任何答案,谢谢。
【问题讨论】:
标签: apache-spark hadoop pyspark hive parquet