【发布时间】:2019-06-09 04:45:59
【问题描述】:
我有一个长的 html 文件,我想提取我给定条件之间的部分 html。
<div style="TEXT-INDENT: 0pt; DISPLAY: block; MARGIN-LEFT: 0pt; MARGIN-RIGHT: 0pt" align="justify">
<font style="DISPLAY: inline; FONT-FAMILY: Times New Roman; FONT-SIZE: 12pt; FONT-WEIGHT: bold">
<font style="DISPLAY: inline; TEXT-DECORATION: underline">ITEM 1A. RISK FACTORS</font></font></div>
---
---
---
---
<div style="TEXT-INDENT: 0pt; DISPLAY: block; MARGIN-LEFT: 0pt; MARGIN-RIGHT: 0pt" align="justify">
<font style="DISPLAY: inline; FONT-FAMILY: Times New Roman; FONT-SIZE: 12pt; FONT-WEIGHT: bold">
<font style="DISPLAY: inline; TEXT-DECORATION: underline">ITEM 1B. UNRESOLVED STAFF COMMENTS</font></font></div>
这两个sn-ps的上面、中间和下面有很多html。我想提取从 ITEM 1A 开始的 html。风险因素并在第 1B 项结束。未解决的员工意见
这是我迄今为止尝试过的,但它只打印包含 ITEM 1A 的 html。风险因素
page_soup = soup(page_html, "html.parser")
for item in page_soup.find_all('font'):
if "ITEM 1A. RISK FACTORS" in item.text:
print(item)
【问题讨论】:
标签: python beautifulsoup