【问题标题】:Click div to collapse table and transform its content in pandas dataframe单击 div 折叠表格并在 pandas 数据框中转换其内容
【发布时间】:2021-11-02 08:21:42
【问题描述】:

有 2 个表格,单击它们会折叠它们。当我进入website 时,第一个表(资产)已经折叠,但不是第二个(负债和权益)。我找不到折叠第二个表并将其转换为熊猫数据框的解决方案。我试图通过 XPATH 和 css-selector 找到它,但 webdriver 没有点击。因为我对 selenium 很陌生,所以我看到了一些教程和 stackoverflow 答案来编写我的代码。

import time
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC
from selenium import webdriver
import pandas as pd
from selenium.webdriver.common.action_chains import ActionChains

chrome_path = r"/usr/bin/chromedriver"
driver = webdriver.Chrome(chrome_path)
wait = WebDriverWait(driver, 20)
url = 'https://www.wsj.com/market-data/quotes/TSLA/financials/annual/balance-sheet'
page = driver.get(url)
element = wait.until(EC.element_to_be_clickable((By.XPATH, "//div[@class='cr_cashflow module']/div[2]")))
ActionChains(driver).move_to_element(element).click().perform()
time.sleep(5)
print(driver.page_source[0][-1])
df = pd.read_html(driver.page_source)[0]
df.to_excel('./tesla_balancesheet_3.xlsx', sheet_name='balance_sheet', index=True)
print(df.tail())
  1. 如何通过单击 div 元素折叠表格,然后将表格转换为数据框?
  2. 您能解释一下为什么即使我将 selenium 置于睡眠状态 5 秒然后手动折叠表格,它也无法从 driver.page_source 读取它吗?

【问题讨论】:

    标签: python pandas selenium selenium-webdriver


    【解决方案1】:

    当我使用 Selenium 打开 https://www.wsj.com/market-data/quotes/TSLA/financials/annual/balance-sheet 时,我可以看到,Assets 已展开,Liabilities & Shareholders' Equity 已折叠,这是第二张表。

    要使其扩展,您必须一直向下滚动到最后,Selenium 可以看到它。

    driver = webdriver.Chrome(driver_path)
    driver.maximize_window()
    driver.implicitly_wait(50)
    driver.get("https://www.wsj.com/market-data/quotes/TSLA/financials/annual/balance-sheet")
    wait = WebDriverWait(driver, 20)
    #element = wait.until(EC.element_to_be_clickable((By.XPATH, "//div[@class='cr_cashflow module']/div[2]")))
    #ActionChains(driver).move_to_element(element).click().perform()
    time.sleep(5)
    driver.execute_script("var scrollingElement = (document.scrollingElement || document.body);scrollingElement.scrollTop = scrollingElement.scrollHeight;")
    time.sleep(5)
    ele = wait.until(EC.element_to_be_clickable((By.XPATH, "//h2[contains(text(), 'Liabilities & Shareholders')]/..")))
    driver.execute_script("arguments[0].scrollIntoView(true);", ele)
    driver.execute_script("arguments[0].click();", ele)
    
    time.sleep(5)
    print(driver.page_source)
    

    进口:

    from selenium.webdriver.support.ui import WebDriverWait
    from selenium.webdriver.common.by import By
    from selenium.webdriver.support import expected_conditions as EC
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-09-16
      • 1970-01-01
      • 2011-05-18
      • 2022-06-15
      • 1970-01-01
      • 2017-09-18
      • 1970-01-01
      相关资源
      最近更新 更多