【问题标题】:How do I stop crawling and close spider based on condition?如何根据条件停止爬行并关闭蜘蛛?
【发布时间】:2014-09-23 10:50:53
【问题描述】:

我有一个蜘蛛,它根据分页网页的特定日期范围获取最新的网址。当它获得所有最新的网址时,我的蜘蛛必须关闭。
如何关闭蜘蛛?
我提到了问题:Force stop the spider
但是引发异常以关闭蜘蛛并不令我高兴。
有没有其他方法可以达到同样的效果?

【问题讨论】:

    标签: scrapy


    【解决方案1】:

    您应该使用Close Spider extension

    关闭蜘蛛的条件可以通过以下设置进行配置:

    CLOSESPIDER_TIMEOUTCLOSESPIDER_ITEMCOUNTCLOSESPIDER_PAGECOUNTCLOSESPIDER_ERRORCOUNT

    【讨论】:

    • 是否可以在此列表中添加自定义标志?
    • 如果您想扩展此功能,您可以创建自己的扩展或轻松扩展关闭蜘蛛。 github
    • 感谢@dataisbeautiful 听起来是比引发异常更好的解决方案。我一定会尝试的。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-06-15
    • 1970-01-01
    • 2017-09-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多