【问题标题】:parse multiple pages without change in url address解析多个页面而不更改 url 地址
【发布时间】:2017-08-04 20:05:30
【问题描述】:

我希望解析来自here 的表格内容。但是,该表继续分成多个页面。我的问题是我无法解析从page 2 开始的页面,因为url 地址没有变化。如何找到存储其他页面的url 地址?我正在使用lxmlrequests

【问题讨论】:

  • 您需要使用selenium 来启动浏览器,这样您就可以让javascript 动态加载页面

标签: javascript python ajax web-scraping lxml


【解决方案1】:

如果您打开 Chrome DevTools 并单击分页控件上的“2”,您将看到脚本请求获取页面“2”的日期:

POST https://www.mutualfundindia.com/MF/return/TopFundDetails?page=2

使用表单数据:

__RequestVerificationToken:AYv1N1VEGXTeLKMbnHolT_bste-CiFcH1GAjQgh1O7c_Ygm0-wIP3j47yN6e5tzYx3EumwCRBYcxI6825nH28W_qO60ZMlnAm4f1utRjqL4wgokl87pgsV4anV4vKtSjk6XV0g2
Rank:-1
Type:-1
Nature:-1
SubNature:-1
cmdAum:1
Period:1Year
ShortingOrder:DESC
hdHeaderId:1Year

您可以在页面上的元素中找到 __RequestVerificationToken 的值:

<input name="__RequestVerificationToken"...

请求的响应是纯 HTML。

我猜,如果你提出这样的请求,你会解析所有的日期。

希望,这会有所帮助。

【讨论】:

猜你喜欢
  • 2021-11-27
  • 2020-06-20
  • 2010-12-26
  • 1970-01-01
  • 2019-03-26
  • 1970-01-01
  • 2013-06-11
  • 2021-09-23
  • 1970-01-01
相关资源
最近更新 更多