【问题标题】:Scrape table data from website python beautiful soup - Access all table entries [closed]从网站python美丽汤中刮取表格数据-访问所有表格条目[关闭]
【发布时间】:2021-08-23 20:49:05
【问题描述】:

我在抓取 FDA 网站时尝试访问表格数据。

https://www.fda.gov/inspections-compliance-enforcement-and-criminal-investigations/compliance-actions-and-activities/warning-letters

在抓取上面的链接时,我只得到了表的 10 个条目。但表中有大约 2500 个条目。使用 F12 键检查了网站,但即使在将“显示条目更改为 50”后也给了我 10 个条目

我想使用 Python beautiful Soup 来访问表的所有条目。我该怎么做?

【问题讨论】:

  • 您需要使用 Javascript 重新创建网站发出的请求以加载其他条目,或者使用 Selenium 等工具自动化网站,让浏览器为您完成这项工作。
  • 请求不支持 JavaScript。最好的办法是结合 Selenium 和网络驱动程序(Firefox/Chrome 等)使用漂亮的汤。您可以无头运行浏览器来模拟请求。但是请求响应正文甚至不会看到那些分页按钮链接。它所看到的只是“#”。

标签: python beautifulsoup


【解决方案1】:

我不确定 Beautiful Soup 是否支持此功能,但您需要通过滚动页面来加载表格行。
这可以通过 Selenium 完成:
读取最初加载的数据,向上滚动页面,读取当前呈现的数据等等,直到呈现页面底部。

【讨论】:

    猜你喜欢
    • 2020-09-28
    • 2015-03-27
    • 1970-01-01
    • 2021-01-15
    • 1970-01-01
    • 1970-01-01
    • 2018-10-15
    • 1970-01-01
    相关资源
    最近更新 更多