【发布时间】:2021-05-14 00:52:25
【问题描述】:
我正在尝试抓取 instagram IGTV 数据(例如,视频标题、观看次数、喜欢、cmets 等)。首先我只使用 BeautifulSoup,但我只能获取前 12 个视频详细信息.然后我开始使用 Selenium,现在我可以获得前 24 个视频细节。但我必须刮掉所有的视频。
下面的代码为我提供了前 24 个视频的超链接,然后我从每个超链接中抓取视频详细信息:
import time
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
#import json
url = 'https://www.instagram.com/agt/channel/?hl=en'
options = Options()
options.add_argument('--headless')
options.add_argument('--disable-gpu')
driver = webdriver.Chrome(chrome_options=options)
driver.get(url)
time.sleep(3)
page = driver.page_source
driver.quit()
soup = BeautifulSoup(page, 'html.parser')
#print(soup)
video_links=[]
for a in soup.find_all('a', class_='_bz0w', href=True):
video_links.append('https://www.instagram.com' + a['href'])
print(video_links)
请建议我如何获取所有视频详细信息。
【问题讨论】:
标签: python selenium beautifulsoup