【发布时间】:2020-04-06 05:54:26
【问题描述】:
我想在 IMDB 网站上保存一些奖项信息,但我无法访问所需的 javascript 文本。
import pandas as pd
import numpy as np
import requests
from bs4 import BeautifulSoup
urls = [
'https://www.imdb.com/event/ev0000003/2000',
'https://www.imdb.com/event/ev0000003/2001',
]
for url in urls:
response = requests.get(url_test).content
soup = BeautifulSoup(response, 'html.parser')
soup.find_all('script', {'type':'text/javascript'})
现在,我怎样才能只访问类别信息:
"categories":[{"categoryName":"Best Actor in a Leading Role","nominations":[{"primaryNominees":[{"name":"Kevin Spacey","note":null,"imageUrl":.....
由于我必须为不同的奖项和年份这样做,我的想法是将它们保存在一个 json 文件中:
{"award": "oscars",
"year": "2000",
"data": [{"categoryName":"Best Actor in a Leading Role","nominations":[{"primaryNominees":[{"name":"Kevin Spacey","note":null,"imageUrl":.....
}
【问题讨论】:
标签: python json web-scraping beautifulsoup