【问题标题】:Retrieve source of web pages by providing file which contains multiple URLs [closed]通过提供包含多个 URL 的文件来检索网页的源 [关闭]
【发布时间】:2013-09-25 14:38:35
【问题描述】:

我想通过提供包含其 URL 列表的文件来下载网页源。 例如,我有一个包含以下 URL 的文件

http://www.adobe.com/support/security/bulletins/apsb09-19.html
http://www.adobe.com/support/security/bulletins/apsb09-20.html                                                                                                

我可以使用urllib 来实现吗,因为我想使用 python 模块而不是 unix 命令(如 wget)?

我想阅读这个文件并将每个 URL 作为 urlopen 或 urlretrieve 的输入,谁能告诉我该怎么做?

【问题讨论】:

  • 您在执行此操作时遇到特定问题吗?你试过什么?
  • 我不知道该怎么做,没试过……
  • @Wayne Werner 你能简单描述一下吗...?
  • @Kummi_10 man wget 应该让你开始......
  • @Wayne Werner 谢谢

标签: python url urllib


【解决方案1】:

尽量分解问题。您有一个文本文件,其中每个 URL 都列在自己的行中。您知道 Python 非常支持逐行读取,这要归功于 open(),并且您可能熟悉 urllibrequests,这取决于您的喜好。

所以你需要做的就是:

  1. Open the file

  2. Read line by line

  3. 将该行用作 URL 字符串

  4. 使用urllibrequests向URL发送请求

  5. 捕获输出并解析/保存

你就完成了!

【讨论】:

  • 可以告诉我如何使用该行作为 URL 字符串...?
  • @Kummi_10 您已将行作为字符串读入 Python,然后需要将该字符串变量传递给负责该操作的 urllib/requests 方法。在2. 中列出的答案中,您可以看到他如何阅读每一行并将其称为“行”。如果你调用你的 'url' 并使用requests.get(url),你应该可以很好地解决剩下的问题。
  • 非常感谢...... :)
猜你喜欢
  • 1970-01-01
  • 2016-12-03
  • 2011-01-10
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-09-19
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多