【发布时间】:2014-12-06 03:32:47
【问题描述】:
我正在用漂亮的汤来解析这个页面:
https://au.finance.yahoo.com/q/is?s=AAPL
我正在尝试获取 27/09/2014 (42,123,000) 的总收入,这是靠近顶部的声明中的第一个值。
我在 chrome 工具中检查了该元素,发现该值在一个类名为 yfnc_tabledata1 的表中。
我的python代码如下:
import requests
import bs4
#get webpage
page = requests.get("https://au.finance.yahoo.com/q/is?s=AAPL")
#put into beautiful soup
soup = bs4.BeautifulSoup(page.content)
#select tag
tag = soup.select("table.yfnc_tabledata1")
到目前为止一切顺利,这会抓取包含所需数据的表,但这是我卡住的地方。
通向我想要的数据的链条如下:
tag > tbody > tr > td > table > tbody > (then the second tr)
但是当我尝试使用它时,我得到一个空元素。
谁能帮我解决这个问题?
还有加分,谁能告诉我如何在更一般的意义上学习提取这样的数据?我经常需要提取隐藏在 HTML 文档中的数据,而且似乎永远无法计算出正确的代码来获取我想要的数据。
非常感谢任何帮助。
【问题讨论】:
标签: python html beautifulsoup html-parsing