【发布时间】:2017-11-02 05:07:03
【问题描述】:
我想抓取 medium.com 上的某个站点,自定义域。 (例如,https://uber-developers.news/)
这些网站总是重定向到“medium.com”并返回到该网站。但是这里有个问题,medium.com 的重定向 url 被它的 robots.txt 所禁止。
这是重定向的方式。
问题出在第二个网址“https://medium.com/m/global-identity?redirectUrl=https://uber-developers.news/”之上,robots.txt 不允许
User-Agent: *
Disallow: /m/
Disallow: /me/
Disallow: /@me$
Disallow: /@me/
Disallow: /*/*/edit
Allow: /_/
Allow: /_/api/users/*/meta
Allow: /_/api/users/*/profile/stream
Allow: /_/api/posts/*/responses
Allow: /_/api/posts/*/responsesStream
Allow: /_/api/posts/*/related
Sitemap: https://medium.com/sitemap/sitemap.xml
我应该考虑第二个网址的 robots.txt 吗?
感谢阅读。
【问题讨论】:
标签: http redirect web-crawler robots.txt