【发布时间】:2019-07-30 13:51:40
【问题描述】:
对于后续网址
https://sports.bwin.com/it/sports#leagueIds=42&sportId=4 我想抓取一个简单的投注报价表。 问题是我不知道要使用哪一部分 od HTML 代码(以及如何使用它)。 这里的表格示例:
我不粘贴 html 代码,因为太长无法粘贴。 这是我的代码,但我总是得到一个空对象
my_url = "https://sports.bwin.com/it/sports#leagueIds=42&sportId=4"
#opening up connection , grabbing page
uClient = uReq(my_url)
page_html = uClient.read()
uClient.close()
header={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/41.0.2227.0 Safari/537.36'}
page=requests.get(my_url,headers=header)
page_soup = bs4.BeautifulSoup(page.content, "html.parser")
betting = page_soup.findAll("table" , {"class": "marketboard-event-without-header__markets-list"})
【问题讨论】:
-
我无法访问该站点(对我来说已被阻止),但我猜该页面是动态的。我会尝试使用硒。你也可以试试 pandas
pd.read_html(),好像有<table>标签一样,pd.read_html()在后台使用 beautifulsoup,会为你做艰苦的工作 -
您是否期望该图像中的所有内容(条形图除外)?还是只是某些部分?
标签: html python-3.x web-scraping beautifulsoup