【发布时间】:2018-01-15 20:07:16
【问题描述】:
我正在尝试从这个网站使用 python 2.7 报废:
http://www.motogp.com/en/Results+Statistics/
我想取消主要的,它有很多类别(事件),出现在 MotoGP Race Classification 2017 蓝色字母旁边的那个
在那次报废之后也是如此。到目前为止,我有:
import re
from bs4 import BeautifulSoup
from urllib.request import urlopen
url = "http://www.motogp.com/en/Results+Statistics/"
r = urlopen(url).read()
soup = BeautifulSoup(r)
type(soup)
match = re.search(b'\"(.*?\.pdf)\"', r)
pdf_url="http://resources.motogp.com/files/results/2017/ARG/MotoGP/RAC/Classification" + match.group(1).decode('utf8')
链接是这种类型:
http://resources.motogp.com/files/results/2017/AME/MotoGP/RAC/Classification.pdf?v1_ef0b514c
所以我应该添加“?”在字符之后。主要问题是如何从一个事件切换到另一个事件来获取这种格式的所有链接。
【问题讨论】:
-
如果我没记错,那么您唯一的目标就是让
pdf链接与每个事件相关联,对吧?如果是,您需要使用 selenium 或任何可以执行点击的浏览器模拟器,因为要使这些pdf链接可见,必须在每个事件上启动点击? -
是的,我想获取链接。
标签: python pdf web-scraping