【问题标题】:Is it possible to run arbitrary Python or R scripts on a "Spark with Yarn" cluster?是否可以在“Spark with Yarn”集群上运行任意 Python 或 R 脚本?
【发布时间】:2020-06-21 13:26:11
【问题描述】:

我正在尝试创建一个执行一些大数据活动的集群。我不确定“SPARK with YARN”集群是否可以运行 Python 或 R 脚本。

如果可能,运行这些脚本的最简单方法是什么?

谢谢。

【问题讨论】:

    标签: r apache-spark hadoop-yarn


    【解决方案1】:

    您应该查看Hadoop Streaming,它允许您运行使用任意编程语言创建的 Hadoop 作业。您只需要提供一对可执行文件(例如 Python 脚本)——一个用于 map 阶段(从输入数据到一组中间键值对),一个用于 reduce 阶段(从那些中间键值与您的工作的输出配对)。

    【讨论】:

    • 感谢您的帮助!我对 Hadoop Streaming 有一些疑问。 1. 那么,用 HS 执行 python 脚本不需要 SPARK 吗? 2.输入/输出只是mapper和reducer所在的目录位置,而mapper/reducer是实际python脚本所在的位置。是这样吗?
    猜你喜欢
    • 2017-04-16
    • 1970-01-01
    • 1970-01-01
    • 2014-09-14
    • 2015-04-25
    • 1970-01-01
    • 2016-01-23
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多