【问题标题】:why amazon best seller rank and ASIN data is not coming?为什么亚马逊畅销书排名和 ASIN 数据没有出现?
【发布时间】:2020-09-25 20:40:32
【问题描述】:
class Me2Spider(scrapy.Spider):
    name = 'me'
    allowed_domains = ['www.amazon.com']
    start_urls = [
        'https://www.amazon.com/dp/B08DL5SQDM?th=1',
        'https://www.amazon.com/dp/B08DL6D52S?th=1',
        'https://www.amazon.com/dp/B01LW14DG7?th=1'
        ]

    def parse(self, response):
        yield{
            'ASIN': response.xpath('//div[@class="a-section table-padding"]/table[@id="productDetails_detailBullets_sections1"]/tbody/tr[1]/td').get(),
            'Ranking': response.xpath('//*[@id="prodDetails"]/div/div[2]/div[2]/div/div[1]/span[3]/text()').get(),
        }

我以前也这样刮过,现在数据出不来了。

【问题讨论】:

  • 请清楚说明您面临的问题。如果有错误,请在问题中发布错误。这将为我们提供详细信息,以更好地帮助您
  • 没有错误。但是当我运行程序时,ASIN 和排名数据并没有被抓取。我想知道为什么NULL来了?

标签: python web-scraping scrapy amazon


【解决方案1】:

问题出在 xpath 中。这就是为什么你会得到一个None 元素,因为程序没有在寻找正确的元素。

如果您查看亚马逊页面的标记,您会发现ASINtable 内。具体是这样的

<table id="productDetails_detailBullets_sections1" class="a-keyvalue prodDetTable" role="presentation">
    <tbody>
        <tr>
            <th class="a-color-secondary a-size-base prodDetSectionEntry">
                ASIN
            </th>
            <td class="a-size-base">
                B08DL5SQDM
            </td>
        </tr>

因此,您可以通过查找带有文本ASINth 标记并在th 元素之后查找td 来访问ASIN 号码。

试试这个代码

url = "https://www.amazon.com/dp/B08DL6D52S?th=1"
driver.get(url)

path = "//th[normalize-space() = 'ASIN']//following-sibling::td"
element = driver.find_element_by_xpath(path)
print(element.text)

根据mozillanormaize-space定义为

normalize-space 函数去除前导和尾随空格 从一个字符串中,用单个替换空白字符序列 空格,并返回结果字符串。

【讨论】:

  • 如果答案解决了您的问题,请点赞并接受答案。这可能会帮助其他面临类似问题的人
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2013-01-18
  • 1970-01-01
  • 2013-08-19
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多