【发布时间】:2017-12-18 13:32:52
【问题描述】:
我遇到了一个问题。我想获取该网站所有公司列表数据的 JSON。
每个链接端点都包含公司特定的数据,例如公司名称、描述、邮政编码、州和地址 我最初的想法是:
- 获取站点列表到列表中
- 可能会再次使用 requests.get 来抓取每个单独的端点
到目前为止,我已经尝试了几种方法,这是我最近的尝试:
import requests
from bs4 import BeautifulSoup
base_url = "http://data-interview.enigmalabs.org/companies/"
r = requests.get(base_url)
soup = BeautifulSoup(r.content, 'html.parser')
links = soup.find_all("a")
link_list = []
for link in links:
print link_list.append("<a href='%s'</a>" %(link.get("href")))
我不知道如何从各个页面中提取我需要的所有数据
【问题讨论】:
-
您的问题具体是什么?这似乎相当广泛。
-
@Carcigenicate 我不知道如何从各个页面中提取我需要的所有数据,然后存储在 JSON 中
标签: python json python-2.7 beautifulsoup bs4