【发布时间】:2020-03-30 19:22:50
【问题描述】:
我正在尝试遍历 2 组链接。从https://cuetracker.net/seasons 开始 > 点击每个赛季链接(过去 5 个赛季),然后点击每个赛季链接中的每个锦标赛链接,并从每个锦标赛中抓取比赛数据。
使用下面的代码,我设法获得了我想要的赛季链接列表,但是当我尝试获取锦标赛链接并将它们放入列表时,它只会获得上赛季的锦标赛链接,而不是每个赛季的链接。
我猜这与 driver.get 只是在下一行代码工作之前完成,我需要使用索引循环/迭代,但我是一个完全的新手,所以我不太确定。
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions
from selenium.webdriver.support.select import Select
from bs4 import BeautifulSoup
import re
import pandas as pd
import os
Chrome_Path = r"C:\Users\George\Desktop\chromedriver.exe"
Browser = webdriver.Chrome(Chrome_Path)
Browser.get("https://cuetracker.net/seasons")
links = Browser.find_elements_by_css_selector("table.table.table-striped a")
hrefs=[]
for link in links:
hrefs.append(link.get_attribute("href"))
hrefs = hrefs[1:5]
for href in hrefs:
Browser.get(href)
links2 = Browser.find_elements_by_partial_link_text("20")
hrefs2 =[]
for link in links2:
hrefs2.append(link.get_attribute("href"))
【问题讨论】:
标签: python selenium selenium-webdriver web-scraping