【问题标题】:how to parse html files in pyspark and use Beautifulsoup?如何在 pyspark 中解析 html 文件并使用 Beautifulsoup?
【发布时间】:2018-04-04 02:16:52
【问题描述】:

我有一个非常困难的情况: 我需要在pyspark中解析一堆html文件,但我还是想用BeautifulSoup来解析html文件。困境是:

  1. 如果我将这些 html 文件保存在 HDFS 中,并使用 pyspark 读取 html 文件,我只能将它们读取为 RDD,但我无法将 RDD 作为BeautifulSoup 中的输入参数;
  2. 如果我将这些html文件保存在本地,并使用BeautifulSoup解析html文件,pyspark的威力就没有发挥出来。

我该怎么做?

【问题讨论】:

    标签: html apache-spark beautifulsoup pyspark hdfs


    【解决方案1】:

    我建议在 PySpark 中编写一个 UDF 函数,该函数将获取此 HTML 列并从 HTML 中返回提取的字段,然后针对 DataFrame 或 RDD 调用它,无论哪个最适合您的问题。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2015-05-23
      • 1970-01-01
      • 2018-10-30
      • 2013-03-10
      • 2020-03-19
      • 2021-02-18
      • 1970-01-01
      相关资源
      最近更新 更多