【发布时间】:2011-04-24 22:41:31
【问题描述】:
我将如何从单个网页开始,比如说在 DMOZ.org 的根目录,并索引附加到它的每个单独的 url。然后将这些链接存储在文本文件中。我不想要内容,只想要链接本身。一个例子会很棒。
【问题讨论】:
-
为什么在 python 中需要这个?
wget无需重新发明轮子就能做到这一点 -
我在最好的操作系统上编程,Windows,而不是 Linux :)。
-
多个级别。未确定的深度。
-
Wget 可用于 Windows。
标签: python hyperlink web-crawler