【发布时间】:2021-07-21 09:33:54
【问题描述】:
我有一个项目要求我使用某个网站从 2010 年到现在抓取所有埃及电影,并形成一个 csv 文件,其中包含数据库所需的表(电影、演员、用户评分、家庭评分等)。 ) 使用美丽的汤。问题是所需的数据在我提取的每个电影链接中,但我需要知道的是如何爬取每个链接中的数据。我需要添加的条件是我只想要电影和某些数据,例如上述(电影、演员、用户评分、家庭评分等)。
parser = 'html.parser'
resp = urllib.request.urlopen("https://elcinema.com/en/index/work/country/eg")
soup = BeautifulSoup(resp, parser, from_encoding=resp.info().get_param('charset'))
for link in soup.find_all('a', href=True):
print(link['href'])
注意:我知道您关心专业精神,并且我尝试按照说明进行操作。另外,我还在学习,这方面的资料很少。
【问题讨论】:
-
用
urlopen( link['href'] )代替print(link['href'])怎么样? -
您应该将代码放入函数中,然后您可以使用
function( link['href'] )代替print(link['href'])
标签: python database csv beautifulsoup jupyter-notebook