【发布时间】:2018-04-02 17:19:27
【问题描述】:
我正在尝试运行以下代码,但注意到bsObj1 的文本在我通过read() 提取其内容后被修改为空白文本。 bsObj3 也被修改为空白文本,而我没有做任何事情。
为什么bsObj1 和bsObj3 会变成空白?如何防止bsObj1被自动更改?
from urllib.request import urlopen
from bs4 import BeautifulSoup
def getLinks(pageUrl):
html1 = urlopen(pageUrl)
html2 = urlopen(pageUrl)
html3 = html1
body1 = html1.read()
bsObj1 = BeautifulSoup(html1)
bsObj2 = BeautifulSoup(html2)
bsObj3 = BeautifulSoup(html3)
print("bsObj1's length is "+str(len(bsObj1.text)))
print("bsObj2's length is "+str(len(bsObj2.text)))
print("bsObj3's length is "+str(len(bsObj3.text)))
if __name__ == '__main__':
getLinks("https://en.wikipedia.org/wiki/Main_Page")
输出:-
bsObj1's length is 0
bsObj2's length is 16000
bsObj3's length is 0
提前非常感谢!
【问题讨论】:
标签: python python-3.x web-scraping beautifulsoup urllib