【发布时间】:2018-04-04 02:16:52
【问题描述】:
我有一个非常困难的情况: 我需要在pyspark中解析一堆html文件,但我还是想用BeautifulSoup来解析html文件。困境是:
- 如果我将这些 html 文件保存在 HDFS 中,并使用 pyspark 读取 html 文件,我只能将它们读取为 RDD,但我无法将 RDD 作为BeautifulSoup 中的输入参数;
- 如果我将这些html文件保存在本地,并使用BeautifulSoup解析html文件,pyspark的威力就没有发挥出来。
我该怎么做?
【问题讨论】:
标签: html apache-spark beautifulsoup pyspark hdfs