【问题标题】:Hive external table to parquet with binary columnsHive 外部表到带有二进制列的镶木地板
【发布时间】:2021-05-16 21:07:03
【问题描述】:

我有 1 个带有架构的镶木地板数据文件;

  • id 整数
  • 模型二进制

此文件是使用 pyspark 创建的,包含模型标识符,并使用 pickle python 库模型二进制文件转储。

是否可以为此 parquet 文件创建 Hive 外部表并在 select 命令后获取输出。假设 Hive 外部表具有完全相同的架构。

CREATE EXTERNAL TABLE default.t_model
(
id integer
, model binary
)
STORED AS PARQUET
LOCATION 'hdfs_path';

我已经完成了上述每个步骤,但总是得到空的答案集。我应该使用 Hive UDF 加载二进制列吗?或者我应该为 parquet 二进制列尝试另一种数据类型,如数组?

感谢任何答案,谢谢。

【问题讨论】:

    标签: apache-spark hadoop pyspark hive parquet


    【解决方案1】:

    看起来我不应该在没有 MSCK REPAIR TABLE 命令的情况下使用分区表。使用 Hive 二进制数据类型,一切正常。

    【讨论】:

    • 你的表没有分区
    猜你喜欢
    • 1970-01-01
    • 2017-11-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-07-04
    相关资源
    最近更新 更多