【发布时间】:2017-09-10 14:35:19
【问题描述】:
我想从这个page 中抓取信息。
具体来说,我想抓取当您单击“TOP 10 HOLDINGS”下的“查看全部”时出现的表格(您必须在页面上向下滚动一点)。
我是 webscraping 的新手,并尝试使用 BeautifulSoup 来做到这一点。但是,似乎有一个问题,因为我需要考虑“onclick”功能。换句话说:我直接从页面中抓取的 HTML 代码不包含我要获取的表格。
我对下一步有点困惑:我应该使用 selenium 之类的东西,还是可以以更简单/更有效的方式处理这个问题?
谢谢。
我当前的代码:
from bs4 import BeautifulSoup
import requests
Soup = BeautifulSoup
my_url = 'http://www.etf.com/SHE'
page = requests.get(my_url)
htmltxt = page.text
soup = Soup(htmltxt, "html.parser")
print(soup)
【问题讨论】:
-
api:
'http://www.etf.com/view_all/holdings/SHE',但必须有my_url作为referer。
标签: python html selenium beautifulsoup scrape