【发布时间】:2021-03-27 12:36:05
【问题描述】:
我正在尝试下载个人Kaggle competition 下的Kaggle 排行榜。我通过“原始数据”输出使用了Kaggle API 和downloaded,但表格数据不完整。
下载的表格不包含关于“参赛人数”和“会员详细信息(如果可用于比赛)”的信息.
我也尝试过抓取表格(基于可用的代码here),但代码无法识别网站上的任何表格:
from bs4 import BeautifulSoup
import requests
import pandas as pd
import re
# Site URL
url="https://www.kaggle.com/c/jane-street-market-prediction/leaderboard"
# Make a GET request to fetch the raw HTML content
html_content = requests.get(url).text
# Parse HTML code for the entire site
soup = BeautifulSoup(html_content, "lxml")
#print(soup.prettify()) # print the parsed data of html
# The following line will generate a list of HTML content for each table
leaderboard = soup.find_all('table', attrs={"class": "competition-leaderboard__table"})
print("Number of tables on site: ",len(leaderboard))
如果有人能在这方面提供帮助,那就太好了。提前致谢!
【问题讨论】:
-
我正在尝试做同样的事情。我注意到表格不是持久的,所以只要你向下滚动顶部就会消失。这意味着即使您一直滚动到底部,也无法选择页面上的所有信息。我得看看Selenium 是否有一些处理这种布局的方法,但我以前从未遇到过。
标签: python web-scraping kaggle