【发布时间】:2019-06-24 13:32:25
【问题描述】:
我想保留 url https://www.horsedeathwatch.com/index.php 并将数据转储到 Pandas 数据框中。
栏如马/日期/路线/死因 我试过 pandas read_html 直接读取这个 url,即使它有 table 标签,它也没有找到 table。
我尝试使用:
url='https://www.horsedeathwatch.com/index.php'
#Create a handle, page, to handle the contents of the website
page = requests.get(url)
#print(page.text)
soup = BeautifulSoup(page.content,'lxml')
然后是 findall('tr') 方法,但由于某种原因无法正常工作。
我想做的第二件事是..每匹马(网页表中的第一列)都有一个带有附加属性的超链接。
关于如何将这些附加属性检索到 pandas 数据框的任何建议
【问题讨论】: