【发布时间】:2018-06-17 14:35:03
【问题描述】:
我已经在本地安装了 spark 2.3.0 并使用了 pyspark。我可以毫无问题地处理本地文件。
但如果我必须从 hdfs 读取数据,我就做不到。
我对 spark 如何访问 hadoop 文件感到困惑。在安装 spark 时,我被要求复制 winutil。不明白winutil的作用是什么。
我们应该先启动 hadoop 服务,然后再使用 spark 吗? 如果我使用外部安装的 hadoop 并尝试在 spark 中使用它,则会出现 java.lang.UnsatisfiedLinkError 错误。任何指向正确文档的指针都会有很大帮助。
谢谢, 基兰
【问题讨论】:
-
如果您使用 pip 安装 PySpark,它不附带任何 Hadoop 库。当然,Hadoop 服务器需要运行(远程,而不是本地)才能访问 HDFS 文件
-
通过stackoverflow.com/questions/34697744/…你应该明白为什么windows需要winutils
-
感谢您的帮助..我试过这个并且工作了..再次感谢
标签: apache-spark pyspark hdfs