【发布时间】:2016-08-08 10:59:34
【问题描述】:
我正在尝试从this website. 中提取数据
有一个表格,其中列出了不同的组织,每个组织的名称是指向包含该组织更多信息的网页的链接。
这些链接不是硬编码的超链接,而是调用 javascript 函数,该函数在调用函数时计算。
<a href="javascript:view_ngo('4309','','1','0')" class="bluelink11px">
BISWASUK SEVASRAM SANGHA
</a>
因此,仅通过链接是不可能抓取信息的。
是否有任何解决方法来执行 javascript 函数并获取结果网页的 HTML?我正在使用 Python 3,并使用 Beautiful Soup 作为网络爬虫。
【问题讨论】:
-
你可以试试 Selenium;这将启动一个浏览器。
-
我认为这样会增加执行时间。我必须浏览 70,000 个网页。 Serge 给出了一个不错的小解决方案。
标签: python python-3.x web-scraping beautifulsoup