【问题标题】:Can I parse PDF file for scraping?我可以解析 PDF 文件以进行抓取吗?
【发布时间】:2020-11-27 17:46:06
【问题描述】:

我一直在尝试了解 Scrapy 的结构。我刚开始将 Scrapy 与 selenium 一起用于 CSS-HTML。我还必须解析一些 PDF 来抓取和挖掘数据。即使我在某些转换器网站上将 pdf 转换为 HTML,我也无法正确解析它。

<p style="position:absolute;top:132px;left:334px;white-space:nowrap" class="ft20"><b>MUAM.</b></p>

这里我有 "ft20" 课程,我应该去挖掘 "MUAM."

<p style="position:absolute;top:148px;left:338px;white-space:nowrap" class="ft20"><b>ADET</b></p>

在这里,我在同一个 "DİV""SPAN" 中再次有 "ft20" 类,但我需要一个带有这个的表信息。

所以问题是我应该使用什么来正确刮取 PDF 文件。另外,你们对从 PDF 转换为 HTML 有什么建议吗?

我希望你能分享我错过的内容,并且一开始就应该知道。

【问题讨论】:

  • 分享示例 pdf 或 pdf 的 url 将有助于检查这一点
  • 这是我要解析并将数据逐行获取到我的表中的 pdf 链接。 link

标签: python pdf web-scraping


【解决方案1】:

我用tabula library 解决了这个问题:

for file in glob.glob("*.pdf"): 
    print(file)
tabula.convert_into(file, "output.csv", output_format="csv", pages='all')

此代码从 pdf 生成 CSV 文件

【讨论】:

    猜你喜欢
    • 2021-01-26
    • 1970-01-01
    • 2019-06-24
    • 2019-03-19
    • 2020-09-30
    • 1970-01-01
    • 2010-09-26
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多