【问题标题】:How to web-scrape the creator-bio on Kickstarter projects with Python & BS4如何使用 Python 和 BS4 在 Kickstarter 项目上抓取创作者简介
【发布时间】:2018-02-28 07:43:37
【问题描述】:

我是一名金融硕士学生,目前正在撰写我的论文。我正在分析影响在 Kickstarter 上成功筹资的可能性的因素。我从 webrobots.io 获得了一个数据集,但是我缺少一些变量(没有获得其完整的公共数据库的链接)。事实上,我需要有关创始人的信息(之前创建的项目数、支持的项目数、fb 朋友数)。此信息仅在单击创始人姓名时才会在窗口中弹出。

因此,我在示例中拥有我的 5000 个项目的 URL,并希望为每个链接抓取 creator-bio。我已经开始看教程(f.e."https://www.youtube.com/watch?v=3xQTJi2tqgk")并且也尝试想出一些东西。当我点击创始人的名字或头像时,所需的弹出窗口打开,当我点击“检查元素”时,我找到了我需要的“div”。但是,在我单击链接之前,这个特定的“div”不存在(对我来说很有意义)。我找到了一个链接('a',它具有相同的 url,但最后只是一个“.../creator-bio”。我认为有一种方法可以打开此链接,然后将信息从必需的“div”。

我将发布到目前为止的代码,但请记住,我没有太多经验,我试图自己弄清楚。

Python:

import requests
from bs4 import BeautifulSoup

url = "https://www.kickstarter.com/projects/551342300/radically-efficient-
design-for-people-transport"

r = requests.get(url)

soup = BeautifulSoup(r.content)

links = soup.find_all("a")

for links in links:
    print "<a href='%s'>%s</a>" %(link.get("href"), link.text)

creator_bio = soup.find_all("a", {"class": "creator-bio"})

print creator_bio

for item in creator_bio:
    print item.text

【问题讨论】:

    标签: python web-scraping beautifulsoup


    【解决方案1】:

    我导航到网址:https://www.kickstarter.com/projects/551342300/radically-efficient-design-for-people-transport/creator_bio

    它会提取姓名、城市/州、上次登录和其他信息。我认为您应该改为抓取此页面。

    【讨论】:

    • 您好亚伯拉罕,感谢您的回答!这绝对有帮助而且很有意义,我可以在所有网址后面添加“/creator_bio”,然后从那里刮掉吗?没想到这个哈哈,非常感谢。
    猜你喜欢
    • 2021-10-20
    • 1970-01-01
    • 2013-12-04
    • 1970-01-01
    • 2019-03-08
    • 1970-01-01
    • 1970-01-01
    • 2021-05-10
    • 1970-01-01
    相关资源
    最近更新 更多