【发布时间】:2017-06-22 15:05:10
【问题描述】:
我正在寻找方法来抓取某个网站上的所有表格。所有子页面中的表格格式完全相同。问题是,那些子页面的url是这样的:
url1 = 'http.../汤姆',
url2 = 'http.../玛丽',
url3 = 'http.../Jason',这样我就无法通过逐步更改 url 来设置循环。 pandas有什么办法可以解决这个问题吗?
【问题讨论】:
-
你提前知道网址是什么吗?你从哪里得到的网址?
-
如何在抓取中使用
pandas? -
您可以尝试使用 pd.read_html() 方法,但是如果没有页面示例,很难提出任何具体的建议。那你能举个例子吗?
-
一个示例网址在这里:hkjc.com/english/racing/horse.asp?HorseNo=S411 实际上我想从这里刮掉所有马匹的比赛历史:hkjc.com/english/racing/SelectHorse.asp
标签: python pandas beautifulsoup