【问题标题】:Download multiple Url's from python Array从 python Array 下载多个 Url
【发布时间】:2021-10-28 12:04:41
【问题描述】:

试图从 python 数组中检索 url。我正在尝试使用 for 循环,但对接下来的步骤有点困惑。网址已从外部站点解析并存储在 files 变量中。

import requests
from bs4 import BeautifulSoup as bs

r = requests.get('https://earth-info.nga.mil/index.php?dir=coordsys&action=gars-20x20-dloads')
soup = bs(r.content, 'html.parser')
files = ['https://earth-info.nga.mil/' + i['href'] for i in soup.select('area')]

print(files)

【问题讨论】:

  • for file in files: print(file)
  • 我正在尝试使用请求库,这一行只是打印出控制台中的每个 url no?
  • 是的。那是对的。你想做什么?你想从这些 url 中迭代和检索 thml 吗?
  • 如果你想使用这些 url 来检索这些 html,只需执行 for file in files: r = requests.get(file)
  • 我正在尝试下载我能够在 files 数组中查询的 url。我想自动执行此任务,因为该文件数组中有 300 多个 url。我也可以选择它们应该所在的路径。

标签: python python-3.x web-scraping beautifulsoup python-requests


【解决方案1】:
import requests
from bs4 import BeautifulSoup as bs

r = requests.get('https://earth-info.nga.mil/index.php?dir=coordsys&action=gars-20x20-dloads')
soup = bs(r.content, 'html.parser')
files = ['https://earth-info.nga.mil/' + i['href'] for i in soup.select('area')]

for file in files:
    r = requests.get(file)
    
    # CODE HERE TO AUTOMATE WHATEVER YOU WANT TO DO

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-28
    • 2019-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多