【发布时间】:2018-04-16 12:58:37
【问题描述】:
我是网络抓取的新手,出于学习目的,我想在https://retty.me/ 网站中找到所有 href 链接。 但我发现我的代码在那个网站上只能找到一个链接。但是我查看了页面源代码,它有很多没有打印的链接。我还打印只有一个链接包含的整页。 我做错了什么?
请纠正我。
这是我的python代码:
from urllib.request import urlopen
from bs4 import BeautifulSoup
import re
data=[]
html = urlopen('https://retty.me')
soup = BeautifulSoup(html,'lxml')
print(soup)
for link in soup.findAll('a', attrs={'href': re.compile("^https://")}):
data.append(link.attrs['href'])
file=open('scraped_data.txt','w')
for item in data:
file.write("%s\n"%item)
file.close()
【问题讨论】:
标签: python beautifulsoup urllib