【发布时间】:2016-10-17 14:59:40
【问题描述】:
我正在尝试使用 beautifulsoup 从https://www.zacks.com/stock/research/MMM/earnings-announcements 下载收益公告数据。当我查看表格时,我感兴趣的表格 (earnings_announcements_earnings_table) 仅显示“正在加载数据……”。但是,如果我打印汤的全部内容,我确实会看到我正在寻找的信息在那里。我可以将这些数据隔离为一个“脚本”元素,但其中包含许多其他不需要的信息。如何仅选择和解析我要查找的特定数据,即“earnings_announcements_earnings_table”表的内容,如下所示:
" 变量 obj = { “earnings_announcements_earnings_table”: [ [“10/25/2016”、“9/2016”、“$2.14”、“--”、“--”、“开盘前”] ,...”
这是我目前所拥有的:
from urllib import request
from urllib import error
from bs4 import BeautifulSoup
def download_parse_earnings(symbol):
request_string = "https://www.zacks.com/stock/research/%s/earnings-announcements" % symbol
print(request_string)
try:
web = request.urlopen(request_string)
except error.HTTPError:
return
soup = BeautifulSoup(web.read(), 'lxml')
data = soup.find_all("script")[28].string
print(data)
【问题讨论】:
-
具体来说,您要检索什么?
标签: python beautifulsoup