【发布时间】:2021-02-16 14:25:49
【问题描述】:
我想循环浏览this 网页中的一些链接,但我不知道该怎么做。我想从中获取链接的部分是这个:
这基本上是页脚。因此,对于我正在尝试做的事情的简要描述,我想刮掉表中列出的证券的所有链接,然后循环浏览页脚,以便我可以更改页面并从这些页面中刮掉链接:
所以目前这是第 1 页,我可以抓取我想要的内容,但我不知道如何进入第二页并继续该过程。稍后我会告诉你原因:
from selenium import webdriver
from bs4 import BeautifulSoup as bs
import time
from requests import get
driver = webdriver.Firefox()
driver.get("http://www.nse.com.ng/market-data/trading-statistics/equities")
time.sleep(30)
html = driver.page_source
soup = bs(html,"html.parser")
driver.close()
以上是我的代码。现在,如果我想找到页脚部分,我会这样做:
foot = soup.find("ul",class_="pagination no-top-pad").find_all("a")
它真正返回页脚/页面列表:
但是,如您所见,它并没有真正使用链接。每个页面的href 下方都有一个简单的"#" 符号。所以我不能只是获取链接并循环浏览它们。这是我的问题。你如何建议我从第 1 页移到第 2 页等等?任何帮助将不胜感激。
【问题讨论】:
标签: html selenium web-scraping beautifulsoup href