【问题标题】:Web Scraping from Oddschecker using BeatifulSoup使用 BeautifulSoup 从 Oddschecker 抓取网页
【发布时间】:2021-01-13 17:06:55
【问题描述】:

我之前可以使用 BeautifulSoup 从 https://www.oddschecker.com/ 抓取数据,但是,现在我得到的只是以下 403 状态:

import requests
import bs4

result = requests.get("https://www.oddschecker.com/")
result.text

输出:

<html>\r\n<head><title>403 Forbidden</title></head>\r\n<body bgcolor="white">\r\n<center><h1>403 Forbidden</h1></center>\r\n<hr><center>nginx</center>\r\n</body>\r\n</html>\r\n

我想知道这个网站上的所有用户是否都一样,或者是否有办法绕过这个(通过另一个网络抓取包或其他代码)并访问网站上可见的实际数据。

【问题讨论】:

    标签: python-3.x web-scraping beautifulsoup scrapy


    【解决方案1】:

    只需添加一个用户代理。它通过禁用 js 来检测您是否是机器人。

    url = 'https://www.oddschecker.com/'
    headers = {'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_5) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36'}
    result = requests.get(url, headers=headers)
    print(result.text)
    

    你也可以使用硒。

    from selenium import webdriver
    driver.get("https://www.oddschecker.com/")
    print(driver.page_source)
    

    【讨论】:

      猜你喜欢
      • 2020-09-17
      • 1970-01-01
      • 1970-01-01
      • 2014-08-16
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-03-27
      相关资源
      最近更新 更多