【问题标题】:Kaggle - Complete Leaderboard DownloadKaggle - 完整排行榜下载
【发布时间】:2021-03-27 12:36:05
【问题描述】:

我正在尝试下载个人Kaggle competition 下的Kaggle 排行榜。我通过“原始数据”输出使用了Kaggle APIdownloaded,但表格数据不完整。

下载的表格不包含关于“参赛人数”和“会员详细信息(如果可用于比赛)”的信息.

我也尝试过抓取表格(基于可用的代码here),但代码无法识别网站上的任何表格:

from bs4 import BeautifulSoup
import requests
import pandas as pd
import re
# Site URL
url="https://www.kaggle.com/c/jane-street-market-prediction/leaderboard"

# Make a GET request to fetch the raw HTML content
html_content = requests.get(url).text

# Parse HTML code for the entire site
soup = BeautifulSoup(html_content, "lxml")
#print(soup.prettify()) # print the parsed data of html

# The following line will generate a list of HTML content for each table
leaderboard = soup.find_all('table', attrs={"class": "competition-leaderboard__table"})
print("Number of tables on site: ",len(leaderboard))

如果有人能在这方面提供帮助,那就太好了。提前致谢!

【问题讨论】:

  • 我正在尝试做同样的事情。我注意到表格不是持久的,所以只要你向下滚动顶部就会消失。这意味着即使您一直滚动到底部,也无法选择页面上的所有信息。我得看看Selenium 是否有一些处理这种布局的方法,但我以前从未遇到过。

标签: python web-scraping kaggle


【解决方案1】:

您可以尝试Meta Kaggle 数据集。它包含团队成员数据和团队和比赛提交的解决方案的文件。

附:解析比赛网页确实很困难——我花了好几个小时试图通过这种方式获取信息。

【讨论】:

    猜你喜欢
    • 2021-03-11
    • 1970-01-01
    • 2021-01-04
    • 1970-01-01
    • 2021-05-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多