【发布时间】:2020-01-23 10:34:42
【问题描述】:
我有一个关于 span 标签的问题,它没有 id 或 class。
更大的方法是从下面的链接中提取“ITEM 1. BUSINESS”到“ITEM 1A. RISK FACTORS”之间的文本。但是,我无法找到找到这部分的方法,因为它所在的跨度没有 id 也没有我可以搜索的类(只有跨度所在的父 div:div = soup.find("div", {"id": "dynamic-xbrl-form"})。
此代码不起作用,遗憾的是:#text = unicodedata.normalize('NFKD', soup.get_text()).replace('\n', '')
这是我的方法:
url = 'https://www.sec.gov/ix?doc=/Archives/edgar/data/934549/000093454919000017/actg2018123110-k.htm#s62CF0831C63E51C2BEF33F4163F1DE65'
raw = requests.get(url)
soup = BeautifulSoup(raw.content)
div = soup.find("span", {"id": ... })
print(div.txt)
你有什么想法或提示吗?
非常感谢 朱利叶斯
【问题讨论】:
标签: python html beautifulsoup text-extraction