【发布时间】:2021-10-28 12:04:41
【问题描述】:
试图从 python 数组中检索 url。我正在尝试使用 for 循环,但对接下来的步骤有点困惑。网址已从外部站点解析并存储在 files 变量中。
import requests
from bs4 import BeautifulSoup as bs
r = requests.get('https://earth-info.nga.mil/index.php?dir=coordsys&action=gars-20x20-dloads')
soup = bs(r.content, 'html.parser')
files = ['https://earth-info.nga.mil/' + i['href'] for i in soup.select('area')]
print(files)
【问题讨论】:
-
for file in files: print(file) -
我正在尝试使用请求库,这一行只是打印出控制台中的每个 url no?
-
是的。那是对的。你想做什么?你想从这些 url 中迭代和检索 thml 吗?
-
如果你想使用这些 url 来检索这些 html,只需执行
for file in files: r = requests.get(file) -
我正在尝试下载我能够在 files 数组中查询的 url。我想自动执行此任务,因为该文件数组中有 300 多个 url。我也可以选择它们应该所在的路径。
标签: python python-3.x web-scraping beautifulsoup python-requests