【问题标题】:How to tranform a JSON database column using Glue and load it to Redshift如何使用 Glue 转换 JSON 数据库列并将其加载到 Redshift
【发布时间】:2019-01-24 15:28:19
【问题描述】:

我正在尝试使用 Glue 复制一些生产数据库(RDS mySQL 到 Redshift)。 我已经取得了一些成功,但是当涉及到包含 JSON 列的数据库时,我正在苦苦挣扎。理想情况下,我会将 JSON 数组拆分为多个列以方便分析。有没有使用 Glue 的简单方法?

如果这看起来很简单,但我对该工具的了解有限,请提前道歉。

【问题讨论】:

  • 您能否在您的问题中发布示例输入和预期输出数据,以便更好地了解这一点?
  • @bdcloud 输入将是一列,其中包含类似 '{"term": null, "medium": "cpc", "source": "facebook", "content": null, "广告系列“:空}'。就输出而言,我最好将其拆分为多个列,否则与 varchar 相同的值就可以了,因为我可以在 SQL 或其他中处理它。

标签: python amazon-web-services aws-glue data-transform


【解决方案1】:

您是否检查了将 Relationalize.apply() 与 AWS Glue API 结合使用的情况?

AWS 中有一个示例: https://aws.amazon.com/blogs/big-data/simplify-querying-nested-json-with-the-aws-glue-relationalize-transform/

问候,

【讨论】:

  • |我试过 Rationalize.apply() 但还是不行。错误消息显示“二进制编码结果集中第 8 列第 6 列中的未知类型 '245”。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2021-08-09
  • 2018-11-03
  • 1970-01-01
  • 2011-07-14
  • 2020-09-29
  • 2020-12-30
  • 2015-08-22
相关资源
最近更新 更多