【发布时间】:2015-06-17 05:53:17
【问题描述】:
我想从http://www.jstor.org/stable/pdf/10.1086/512825.pdf 抓取一个 pdf 文件,但它要我接受条款和条件。从浏览器下载时,我发现 JSTOR 将我的接受保存在 2 个名为 JSESSIONID 和 SessionData 的 cookie 中,但 python-requests 不抓取这两个 cookie(它抓取另外两个 cookie,但不抓取这些)。
这是我的会话实例化代码:
def get_raw_session():
session = requests.Session()
session.headers.update({'User-Agent': UserAgent().random})
session.headers.update({'Connection': 'keep-alive'})
return session
请注意,我之前曾多次将 python-requests 用于需要登录的站点,并且效果很好,但在这种情况下并非如此。
我想问题是 JSTOR 是用 jsp 构建的,而 python-requests 不支持。
有什么想法吗?
【问题讨论】:
-
如何进行子序列请求?
-
r = session.get(link)
标签: python django session cookies python-requests