【发布时间】:2017-10-12 23:47:29
【问题描述】:
我正在尝试从这篇文章 (https://www.vanityfair.com/style/society/2014/06/monica-lewinsky-humiliation-culture) 中提取文章文本并排除底部的合法容器。文本部分似乎很简单,但似乎无法摆脱容器。为了方便使用,我已将其与合法变量分开。
到目前为止,这是我的代码:
import requests
from bs4 import BeautifulSoup
base_url = 'https://www.vanityfair.com/style/society/2014/06/monica-lewinsky-humiliation-culture'
r = requests.get(base_url)
r_html = r.text
soup = BeautifulSoup(r_html)
legal = soup.find('div',{'class': 'legal-container'})
paragraphs = soup.find_all('p')
for text in paragraphs:
print text.get_text()
我该怎么办?
【问题讨论】:
-
不是排除,你不能定义一个比所有
p标签更好的选择吗? -
我试过了,但似乎找不到好方法。所有文本,包括合法容器中的文本,都有
等标签。合法容器具体是在
直到
内;有没有一种好方法可以排除那些专门或更好定义的 p 标签?
-
选择器
div.article-main p怎么样?文章中的所有段落
标签: python beautifulsoup