【发布时间】:2018-02-28 07:43:37
【问题描述】:
我是一名金融硕士学生,目前正在撰写我的论文。我正在分析影响在 Kickstarter 上成功筹资的可能性的因素。我从 webrobots.io 获得了一个数据集,但是我缺少一些变量(没有获得其完整的公共数据库的链接)。事实上,我需要有关创始人的信息(之前创建的项目数、支持的项目数、fb 朋友数)。此信息仅在单击创始人姓名时才会在窗口中弹出。
因此,我在示例中拥有我的 5000 个项目的 URL,并希望为每个链接抓取 creator-bio。我已经开始看教程(f.e."https://www.youtube.com/watch?v=3xQTJi2tqgk")并且也尝试想出一些东西。当我点击创始人的名字或头像时,所需的弹出窗口打开,当我点击“检查元素”时,我找到了我需要的“div”。但是,在我单击链接之前,这个特定的“div”不存在(对我来说很有意义)。我找到了一个链接('a',它具有相同的 url,但最后只是一个“.../creator-bio”。我认为有一种方法可以打开此链接,然后将信息从必需的“div”。
我将发布到目前为止的代码,但请记住,我没有太多经验,我试图自己弄清楚。
Python:
import requests
from bs4 import BeautifulSoup
url = "https://www.kickstarter.com/projects/551342300/radically-efficient-
design-for-people-transport"
r = requests.get(url)
soup = BeautifulSoup(r.content)
links = soup.find_all("a")
for links in links:
print "<a href='%s'>%s</a>" %(link.get("href"), link.text)
creator_bio = soup.find_all("a", {"class": "creator-bio"})
print creator_bio
for item in creator_bio:
print item.text
【问题讨论】:
标签: python web-scraping beautifulsoup