【发布时间】:2013-10-06 23:14:00
【问题描述】:
最近我正在使用curl根据我的登录帐户从stackoverflow.com抓取推荐的问题列表。
目前,为了在HTTP请求中注册我的帐户信息,我将标题+cookies(由我的浏览器显示)复制并粘贴到一个文件中,编写了一个脚本,其中curl用于抓取数据。
但是,正如我所注意到的,Cookie 字段中的某些键,如浏览器发送的 __utma 和 __utmb,会定期更改,因此我必须相应地更新脚本中的 cookie 值,否则,我将无法根据我的帐户信息获得结果。
我这边的这个必要更新确实很麻烦。
我的困惑是: 1、为什么浏览器发送的cookie字段经常变化?这背后的原因是什么? 2、有没有办法让CURL表现得像浏览器一样,让它能像浏览器一样适配cookie?
【问题讨论】:
标签: http web-crawler session-cookies