【问题标题】:Should I consider robots.txt when url is redirected to other domain?当 url 被重定向到其他域时,我应该考虑 robots.txt 吗?
【发布时间】:2017-11-02 05:07:03
【问题描述】:

我想抓取 medium.com 上的某个站点,自定义域。 (例如,https://uber-developers.news/

这些网站总是重定向到“medium.com”并返回到该网站。但是这里有个问题,medium.com 的重定向 url 被它的 robots.txt 所禁止。

这是重定向的方式。

  1. https://uber-developers.news/

  2. https://medium.com/m/global-identity?redirectUrl=https://uber-developers.news/

  3. https://uber-developers.news/?gi=e0f8caa9844c

问题出在第二个网址“https://medium.com/m/global-identity?redirectUrl=https://uber-developers.news/”之上,robots.txt 不允许

https://medium.com/robots.txt

User-Agent: *
Disallow: /m/
Disallow: /me/
Disallow: /@me$
Disallow: /@me/
Disallow: /*/*/edit
Allow: /_/
Allow: /_/api/users/*/meta
Allow: /_/api/users/*/profile/stream
Allow: /_/api/posts/*/responses
Allow: /_/api/posts/*/responsesStream
Allow: /_/api/posts/*/related
Sitemap: https://medium.com/sitemap/sitemap.xml

我应该考虑第二个网址的 robots.txt 吗?

感谢阅读。

【问题讨论】:

    标签: http redirect web-crawler robots.txt


    【解决方案1】:

    robot.txt 文件只是指示爬虫他们应该做什么,但它们,绝对不能禁止爬虫做不同的事情。 Medium 所做的只会阻止礼貌和尊重的爬虫。

    您需要遵循重定向(例如,如果您使用 CURL,则有一个选项),您将到达您想要的页面。但如果你大规模地这样做,Medium 可能对此并不满意。

    【讨论】:

    • 感谢您的评论。决定是否抓取 medium.com 非常有用。也许我们不会抓取 medium.com。
    猜你喜欢
    • 2019-02-16
    • 2016-02-29
    • 1970-01-01
    • 2017-12-13
    • 1970-01-01
    • 2012-03-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多