【发布时间】:2017-07-12 06:09:39
【问题描述】:
这里是 Python nube。我知道将 URL 解析为 BeautifulSoup 以打开 URL 的两种方法。
方法 #1 使用请求
from bs4 import BeautifulSoup
import requests
page = requests.get(url)
soup = BeautifulSoup(page.content, 'html.parser')
print soup.prettify()
方法 #2 使用 URLLIB/URLLIB2
from bs4 import BeautifulSoup
import urllib2
f = urllib2.urlopen(url)
page = f.read() #Some people skip this step.
soup = BeautifulSoup(page)
print soup.prettify()
我有以下问题:
BeautifulSoup() 函数究竟是做什么的?某处需要
page.content和html.parser,而某处只需要urllib2.urlopen(url).read(如第二个示例中所述)。这很容易补习,但很难理解这里发生了什么。我检查了官方文档,不是很有帮助。 (也请评论html.parser和page.content,为什么不像第二个例子那样只是html 和页面?)在上述方法#2中,如果我跳过
f.read()命令会有什么不同?
对于专家来说,这些问题可能非常简单,但我非常感谢您提供这些帮助。我用谷歌搜索了很多,但仍然没有得到答案。 谢谢!
【问题讨论】:
-
1.您可能想阅读文档:crummy.com/software/BeautifulSoup/bs4/doc/#making-the-soup 2。这样就行不通了。
标签: python python-2.7 beautifulsoup