【发布时间】:2009-12-05 22:28:40
【问题描述】:
我正在用 Python 编写一个蜘蛛来抓取一个网站。麻烦的是,我需要检查大约 250 万页,所以我真的可以使用一些帮助来优化速度。
我需要做的是检查页面是否有一定数量,如果找到则记录该页面的链接。蜘蛛很简单,它只需要对很多页面进行排序。
我对 Python 完全陌生,但之前使用过 Java 和 C++。我还没有开始编写它,所以任何关于要包含的库或框架的建议都会很棒。任何优化提示也非常感谢。
【问题讨论】:
-
加快处理速度的最佳选择是提高连接速度。那将是您的瓶颈,而不是 Python 速度。
标签: python web-crawler