【发布时间】:2021-04-24 05:40:01
【问题描述】:
我需要页面上不同文章的正文部分。它们被写在一个 section 标签中,每个段落包含几个 p 标签。喜欢:
<section class="...">
<div>...</div>
<figure>...</figure>
<p id='...' class='...'></p>
<p id='...' class='...'></p>
<p id='...' class='...'></p>
</section>
<section class="...">
<div>...</div>
<figure>...</figure>
<p id='...' class='...'></p>
<p id='...' class='...'></p>
<p id='...' class='...'></p>
</section>
如果我使用下面的代码:
import requests
import re
from bs4 import BeautifulSoup
r = requests.get('url')
all_bodies = soup.find_all('section')
for i in range(len(all_bodies)):
print(all_bodies[i])
它返回部分的完整内容,如果我将 p 标签添加到 find_all,它会将每个 p 标签作为列表的一个元素返回,但我希望一个部分的整个 p 标签在一个列表元素中。
【问题讨论】:
标签: python web-scraping beautifulsoup python-requests tags