【发布时间】:2020-11-27 17:46:06
【问题描述】:
我一直在尝试了解 Scrapy 的结构。我刚开始将 Scrapy 与 selenium 一起用于 CSS-HTML。我还必须解析一些 PDF 来抓取和挖掘数据。即使我在某些转换器网站上将 pdf 转换为 HTML,我也无法正确解析它。
<p style="position:absolute;top:132px;left:334px;white-space:nowrap" class="ft20"><b>MUAM.</b></p>
这里我有 "ft20" 课程,我应该去挖掘 "MUAM."
<p style="position:absolute;top:148px;left:338px;white-space:nowrap" class="ft20"><b>ADET</b></p>
在这里,我在同一个 "DİV" 或 "SPAN" 中再次有 "ft20" 类,但我需要一个带有这个的表信息。
所以问题是我应该使用什么来正确刮取 PDF 文件。另外,你们对从 PDF 转换为 HTML 有什么建议吗?
我希望你能分享我错过的内容,并且一开始就应该知道。
【问题讨论】:
-
分享示例 pdf 或 pdf 的 url 将有助于检查这一点
-
这是我要解析并将数据逐行获取到我的表中的 pdf 链接。 link
标签: python pdf web-scraping