【发布时间】:2023-01-01 23:46:14
【问题描述】:
我正在尝试抓取这个网站:https://novel5s.com/bye-my-irresistible-love-by-goreous-novel5-online-2138/148981.html。
问题是文本保存在属性中并在每次重新加载时随机化。有人可以帮我用 python 废弃这个页面吗?
双击底部的段落,你会发现一切都不是文本。 感谢您提供的任何帮助。
我的代码:
from bs4 import BeautifulSoup
from selenium import webdriver
import chromedriver_autoinstaller
from selenium import webdriver
from selenium.webdriver import Keys, ActionChains
from selenium.webdriver.chrome.service import Service
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC
chromedriver_autoinstaller.install()
chrome_options = Options()
chrome_options.add_experimental_option( "prefs",{'profile.managed_default_content_settings.javascript': 2})
driver = webdriver.Chrome(options=chrome_options)
driver.maximize_window()
driver.get("https://novel5s.com/bye-my-irresistible-love-by-goreous-novel5-online-2138/148981.html")
time.sleep(2)
text = driver.find_element(By.CSS_SELECTOR,".content-book")
for i in text.find_elements(By.CSS_SELECTOR,"*"):
attrs=[]
soup = BeautifulSoup(i.get_attribute("outerHTML"),"html.parser")
try:
# print(soup.find("p").text)
print(soup.find("p").attrs.values())
except:
pass
print("null")
我正在尝试获取段落标签不同属性内的完整段落。我知道如何获取标签的所有属性,但问题是有多个属性,其中一些只是为了防止抓取。我想要完整的段落。
【问题讨论】:
标签: python selenium selenium-webdriver