【问题标题】:Is there away to share/access the hdfs among developers?是否可以在开发人员之间共享/访问 hdfs?
【发布时间】:2019-10-31 17:50:54
【问题描述】:

我是大数据和蜂巢的新手。 需要与其他开发人员合作开发 Spark 流应用程序,其中涉及从 Kafka 读取数据并将其放置在 hive/hdfs 上。其他开发人员使用/指向 hdfs 的相同位置,读取 hive 文件并进行进一步处理。

我的开发环境是 Windows 系统上的 Eclipse。 其他开发者环境是他机器上的 Eclipse。

由于两者都在处理相同的文件,我们之间是否可以共享 hdfs 路径?

请分享 Spark 开发团队如何处理此类场景的详细信息?

建议最佳实践等

非常感谢, 夏姆

【问题讨论】:

    标签: apache-spark hadoop hive apache-kafka spark-streaming


    【解决方案1】:

    您需要设置多节点 hadoop 集群并将所有开发者系统 IP 配置为数据节点,以便它们可以共享相同的 HDFS。

    Hadoop 的主要配置文件:core-site.xml,hdfs-site.xml,mapred-site.xml & yarn-site.xml

    完成后,您可以通过 HDFS 安装 Hive 和 Spark。

    请参考安装链接: https://www.linode.com/docs/databases/hadoop/how-to-install-and-set-up-hadoop-cluster/ https://dzone.com/articles/setting-up-multi-node-hadoop-cluster-just-got-easy-2

    【讨论】:

    • 谢谢 Nikk,我们有一个 hadoop 集群,但是如何从本地指出呢?即如何从我的 eclipse 开发环境写入 hdfs 位置的路径?
    • 本地是指你正在开发代码的Windows系统吗?如果是,那么我认为您将无法直接从您的 IDE 连接。您可以编写代码并在 Hadoop 集群的边缘节点上运行该 jar。您可以使用 Windows 系统中的 putty 连接边缘节点并运行该 jar 或写入 Hdfs
    • 是的,不幸的是我正在使用 Windows 作为我的开发机器。 hdfs 集群在 linux 上。
    • 如果使用 Ubantu 进行本地开发,我能否访问 hdfs 文件夹,即集群上的哪个文件夹?
    • 是的,因为您不需要 Linux 系统,只需在窗口机器上开发代码并使用 WinSCP 将该 jar 移动到 Linux 系统。将您的 Putty 连接到 Hadoop 安装并运行该 jar 的 Linux 系统。这会很容易。如果可以从不属于 Hadoop 集群的本地连接 hdfs,那么这可能会产生简单的安全问题。唯一可能的解决方案是使用 Putty。 :)
    猜你喜欢
    • 1970-01-01
    • 2021-04-26
    • 1970-01-01
    • 2019-04-22
    • 2015-07-13
    • 2015-11-28
    • 1970-01-01
    • 1970-01-01
    • 2019-03-08
    相关资源
    最近更新 更多