【问题标题】:Scrapy - missing html bodyScrapy - 缺少 html 正文
【发布时间】:2019-04-10 20:57:50
【问题描述】:

使用scrapy的一些网站不提供完整的html代码,即。 https://www.amazon.de/Warner-Bros-5051891109537-GIOCO-MOVIE/dp/B00HR6RHBK

我尝试获取所有商品列表的链接 (https://www.amazon.de/gp/offer-listing/B00HR6RHBK/ref=dp_olp_new?ie=UTF8&condition=new)

Scrapy 就是找不到它。

尝试:

$scrapy shell "https://www.amazon.de/Warner-Bros-5051891109537-GIOCO-MOVIE/dp/B00HR6RHBK"

print(response.xpath("//a[contains(@href, 'new')]/@href"))

结果:

[]

【问题讨论】:

    标签: html scrapy


    【解决方案1】:

    该链接在页面源中不存在。所以Scrapy找不到它。尝试查找 /gp/offer-listing/B00HR6RHBK/ref=dp_olp_all_mbc?ie=UTF8&condition=all 看看是否能找到该链接

    【讨论】:

    • 如果我尝试通过 scrapy 或 wget 尝试,我不能,但我可以在使用 Chrome/Firefox/etc 进行检查时。 - Splash 是一个解决方案吗?
    猜你喜欢
    • 2021-07-17
    • 2017-06-16
    • 1970-01-01
    • 1970-01-01
    • 2012-09-10
    • 1970-01-01
    • 2015-06-24
    • 2016-04-30
    相关资源
    最近更新 更多