【问题标题】:PyQuery Code for a Web ScraperWeb Scraper 的 PyQuery 代码
【发布时间】:2015-03-20 20:22:35
【问题描述】:

我对 python 有点陌生,但我正在尝试制作一个网络爬虫脚本,它可以下载网站上的所有图片。我正在使用 requests 和 PyQuery,因为很多人在研究后推荐了它。这就是我现在所拥有的一切,我不知道该去哪里。

r = requests.get("some url")
images = pq(r.text)
for image in images.find("img"):

我知道我需要获取 img 的来源,但是在找到 img 标签后我该怎么做呢?另外,我查看了一些 html 的页面源,一些图片存储在他们的数据库中,所以 src 以“/”一些扩展名开头,所以我想知道如何才能获得完整的 url。

【问题讨论】:

标签: python pyquery


【解决方案1】:

(python3)

from pyquery import PyQuery as pq
import requests
from urllib.parse import urljoin

url = "..."
response = requests.get(url).text
for image in pq(response)("img") :
    imgurl = urljoin(url,image.get("src"))

为你辩护,the pyquery docs 似乎已经过时了。 urllib 负责将相对 URL 合并为绝对 URL。

【讨论】:

    猜你喜欢
    • 2016-09-11
    • 1970-01-01
    • 1970-01-01
    • 2021-10-19
    • 1970-01-01
    • 2021-10-29
    • 1970-01-01
    • 2019-04-05
    • 1970-01-01
    相关资源
    最近更新 更多