【问题标题】:Whitelisting Azure Databricks Spark Cluster on AWS Redshift将 AWS Redshift 上的 Azure Databricks Spark 集群列入白名单
【发布时间】:2021-04-05 22:51:37
【问题描述】:

您好,我不确定以前是否有人遇到过这种情况。我有 Azure 和 AWS 环境。我有一个在 Azure Databricks 上运行的 Spark 集群。我有一个要在 Azure Databricks Spark 群集上运行的 python/pyspark 脚本。在这个脚本中,我想将一些数据写入我计划使用 psycopg2 库的 AWS Redshift 集群。在哪里可以找到 Azure Databricks Spark 集群的 IP 地址,以便我可以将其列入 AWS Redshift 集群的安全组中。我认为目前我无法写入 AWS Redshift 集群,因为该脚本正在 Azure Databricks Spark 集群上运行,并且 AWS Redshift 集群无法识别来自 Azure Databricks Spark 集群的此请求。

【问题讨论】:

  • 您找到解决方案了吗?
  • 您需要在 AWS 中将 Azure 的 IP 地址列入白名单。如果我没记错的话,我得到了 IP 地址并通过代码本身将其列入白名单。您也可以尝试答案中提到的方式。

标签: amazon-web-services azure amazon-redshift databricks azure-databricks


【解决方案1】:

我有类似的用例从 Azure Databricks 连接到 AWS RDS。需要将连接到 RDS 的 AWS 安全组中的 Azure Databricks IP 列入白名单。 Databricks 将集群与动态 IP 相关联,因此每次重启集群时它都会发生变化。

我正在尝试解决此问题

  1. 在 Azure 门户中创建公共 IP 地址
  2. 将公共 IP 地址关联到虚拟机

https://docs.microsoft.com/en-us/azure/virtual-network/associate-public-ip-address-vm#azure-portal

当前出现错误,我无权更新与 VNet 关联的数据块。

这是我能想到的最简单的解决方案。 如果这不起作用,下一个选项是尝试站点到站点连接以在 Azure 和 AWS 之间建立隧道。这将允许授权所有动态 IP 在 AWS 上进行读写操作。

【讨论】:

  • 我能够使用 python 库获取 Azure Databricks Spark 集群的公共 IP 地址。挑战与您上面提到的相同,即在您创建新集群或重新启动集群后创建一个新 IP 地址。如果有办法(我相信有)以编程方式将 AWS Redshift 的 IP 地址列入白名单,那么它就解决了我们的问题,因为每次创建或重新启动集群时,我们都可以动态地将 IP 地址列入白名单。
猜你喜欢
  • 2020-01-09
  • 1970-01-01
  • 1970-01-01
  • 2020-02-29
  • 1970-01-01
  • 2021-06-22
  • 2021-10-15
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多