【问题标题】:I can't seem to scrape hrefs or text from web我似乎无法从网络上抓取 href 或文本
【发布时间】:2021-04-29 11:39:18
【问题描述】:

我尝试了各种方法,包括通过完整的 xpath 搜索和通过类查找,然后通过 a 标签搜索 href。我已经做了好几个小时了,但我似乎无法理解。任何帮助将不胜感激。

from selenium import webdriver 
import time
namelist=[]
driver=webdriver.Chrome()
driver.get("https://waxpeer.com/")
time.sleep(15)

当我使用 .text 时它不起作用

search=driver.find_elements_by_xpath('//*[@id="container"]/div/div/a')
print(search)
namelist.append(search)

【问题讨论】:

    标签: python web-scraping beautifulsoup python-requests


    【解决方案1】:

    嘿,你可以使用time 模块延迟加载元素,以便它可以找到关联标签

    正如你在这段代码中提到的,你可以从div标签container中提取href链接

    代码:

    from selenium import webdriver 
    import time
    path="C:\Program Files (x86)\chromedriver.exe"
    driver=webdriver.Chrome(path)
    driver.get("https://waxpeer.com/")
    time.sleep(10)
    main_div=driver.find_elements_by_xpath('//*[@id="container"]')
    for divs in main_div:
        links=div.find_elements_by_tag_name("a")
        for link in links:
            print(link.get_attribute('href'))
    

    输出:

    https://waxpeer.com/sport-gloves-vice-field-tested/item/21642893513 ...

    【讨论】:

    • 非常感谢您,您认为这也适用于 hrefs 吗?
    • @JoshMurphy 试试吧,我想它应该可以工作!
    • 由于某种原因,它不适用于 href 链接。我不是usd o selenium tho。我可以获取社交链接等内容的 href 链接,但无法获取项目的链接
    • 你能更新你的代码吗?或者指出你想废弃哪个href以便更好地理解
    • 我更新了代码难懂吗?
    猜你喜欢
    • 2023-03-24
    • 1970-01-01
    • 2021-12-20
    • 2021-09-23
    • 1970-01-01
    • 2022-11-17
    • 2020-01-16
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多