【发布时间】:2022-01-25 06:19:59
【问题描述】:
我正在做一个项目,试图从存档网站上抓取文章。例如,下面是存档 url 和原始 url。我有存档网址。我想使用 Selenium 来提取原始 url。
存档网址:https://archive.is/xXAoL
原始网址:https://beforeitsnews.com/eu/2021/08/breaking-germany-halts-all-covid-19-vaccines-says-they-are-unsafe-and-no-longer-recommended-2676130.html?fbclid=IwAR3JPcxNHlZ5eQHLyO2teh6_xcrerisBrCNeleOZz7qmxI7_pDJDBlEAIjU
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
url = "https://archive.is/xXAoL"
driver = webdriver.Chrome('./chromedriver')
driver.get(url)
关于如何获取原始网址的任何建议?
方法一
可能有用的一件事是规范链接是
https://archive.is/2021.09.07-145059/https://beforeitsnews.com/eu/2021/08/breaking-germany-halts-all-covid-19-vaccines-says-they-are-unsafe-and-no-longer-recommended-2676130.html?fbclid=IwAR3JPcxNHlZ5eQHLyO2teh6_xcrerisBrCNeleOZz7qmxI7_pDJDBlEAIjU
我可以在第二个 https 之前删除一些东西。但是,该方法不起作用,因此寻找另一种不依赖元的方法。
【问题讨论】:
标签: python selenium xpath css-selectors webdriverwait