【发布时间】:2019-07-21 01:47:53
【问题描述】:
过去两天我一直在完善我想要抓取的网站的网址列表。我的脚本(除了数据提取之外与CheerioCrawler 的示例基本相同)正在运行,但是有一个问题。本地保存在数据存储中的一些文档不完整。例如,在示例脚本中,某些已保存数据中的标题字段为空白。在其他人中,这一切都被保存了。每次唯一保存的字段是url: request.url。
我最好的猜测是,我正在抓取的域非常慢,从其他域加载了多个脚本,而 Cheerio 只是快速浏览,而不是等待整个页面完全加载,然后再提取它可以提取的任何数据找到,然后继续。
要抓取的页面总数约为 2500,所以我不介意这个过程是否缓慢,但我想确保它是完整的。
如何确保页面在提取之前已完全加载?我认为async 函数会自动执行此操作。
【问题讨论】:
标签: javascript web-crawler puppeteer apify