【发布时间】:2015-08-12 13:45:35
【问题描述】:
我最近在学习 python 和 scrapy。我用谷歌搜索并搜索了几天,但我似乎没有找到任何关于如何在具有隐藏网址的网站上抓取多个页面的说明 - <a href="javascript:;"。基本上每个页面包含20个listing,每次点击“>>”按钮,都会加载接下来的20个listing。我不知道如何找到实际的 url,下面是源代码供您参考。非常感谢任何指针和帮助。
【问题讨论】:
-
据我所知,按钮是用锚元素实现的?在不知道网站是什么的情况下,很难提供帮助。我的猜测是,锚点 onClick 事件被绑定到一些 javascript 函数,该函数在单击锚点时触发 AJAX 调用。根据站点(以及它的混淆程度),跟踪实际 HTTP 请求的位置可能具有挑战性。
-
你可以在rent.591.com.hk看到这个网站,它是中文的,但你可以在右上角将它切换为Eng。任何进一步的帮助都非常感谢 junnytony
-
检查浏览器开发者工具中的网络标签,了解该网站正在执行哪些请求。
-
我试过了,在网络选项卡的顶部显示“rent.591.com.hk/…”。我复制了这个 URL 并将其粘贴到浏览器上,显示的是空白页面。在 Network Tab -> Initiator 下,它显示 query-1.8.2.min.js:2,不确定它是否告诉我任何信息。顺便说一句,我继续尝试 Selenium 来模拟单击下一页的 >> 按钮,当我在单击操作后检查 URL (driver.current_url) 时,它始终显示 rent.591.com.hk/#list,该 URL 仍然隐藏。如果有人能帮我解决这个问题,我将不胜感激
标签: javascript python pagination web-crawler scrapy