【问题标题】:Impala access to existing Parquet tables in S3Impala 访问 S3 中现有的 Parquet 表
【发布时间】:2015-07-30 15:09:09
【问题描述】:

我有一些 Parquet 表是使用存储在 S3 中的 SparkSQL 创建的。我也希望能够从 Impala 使用它们。我还有一个在 CDH5 上运行的 Impala 实例,我可以使用 Hue 访问它。

我需要怎么做才能从这个 Impala 实例中查询上述数据?

Impala Parquet 文档似乎主要是关于将数据导入 Parquet。我已经拥有 Parquet 中的数据,我只想将 Impala 指向它。我是 Impala 和 Hue 的新手,我对 Parquet 的体验来自 SparkSQL。

【问题讨论】:

  • 通常需要创建一个指向该文件的外部表,然后在其上执行SQL语句

标签: amazon-s3 cloudera-cdh hue impala parquet


【解决方案1】:

Impala 有 experimental support 查询存储在 S3 中的数据。下面是一个示例 CREATE TABLE 语句,用于处理存储在 S3 中的 Parquet 数据,取自上一句中链接的文档:

create table sample_data_s3 (id int, id bigint, val int, zerofill
string, name string, assertion boolean, city string, state string)
stored as parquet location 's3a://impala-demo/sample_data';

【讨论】:

  • 谢谢杰夫!这就是我所追求的。还有一种方法可以让 Impala 从 Parquet 中获取列规范,而不是使用 create 语句指定它们吗?我的架构有相当多的列,不用全部输入就好了。
  • 当然要“创建表......像镶木地板”;参看。 cloudera.com/content/cloudera/en/documentation/cloudera-impala/….
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2013-12-28
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-01-07
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多