【问题标题】:Why is the forward DNS needed to verify crawlers为什么需要前向 DNS 来验证爬虫
【发布时间】:2017-09-25 17:25:54
【问题描述】:

来自谷歌的支持网站 -

验证 Googlebot 是否为调用者:

对来自日志的访问 IP 地址运行反向 DNS 查找, 使用主机命令。验证域名是否在 googlebot.com 或 google.com 在域上运行正向 DNS 查找 使用检索到的主机命令在步骤 1 中检索到的名称 域名。验证是否与原访问IP相同 您的日志中的地址。

我的问题是为什么需要正向 DNS 查找?攻击者可以创建crawl-xx-xx-xx-xx.googlebot.com 形式的 DNS 记录吗?

我实际上在我的日志中看到了这一点 - 也来自其他爬虫。 Ip 是,如果我反向 DNS 查找来自正确的域,但正向查找不返回 IP。想知道这怎么可能..

【问题讨论】:

    标签: dns web-crawler search-engine


    【解决方案1】:

    任何人都可以为反向区域提供服务。如果您拥有 IP 空间,并让您的 isp 进行正向反向查找,您可以提供指向任何您想要的任何东西的反向区域。

    作为攻击者,我可以购买任何 IP 块并为我的区域 4.3.2.1.in-addr.arpa 提供服务,该区域表示所有记录都在 crawl-xx-xx-xx-xx.googlebot.com

    我无法控制该区域的谷歌转发 dns。因此,即使我可以对1.2.3.4 进行反向查找以返回crawl-12-34-56-78.googlebot.com,我也无法对crawl-12-34-56-78.googlebot.com 进行正向查找以返回1.2.3.4

    您的日志中不一致的条目几乎可以肯定是第三方机器人试图(非常好)冒充谷歌。

    【讨论】:

    • 谢谢你,这很清楚。我看到大量的百度蜘蛛 UA 也呈现出这种确切的行为。不知道是不是各大搜索引擎爬虫都遵守这种做法?
    猜你喜欢
    • 1970-01-01
    • 2012-08-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-22
    • 1970-01-01
    • 2023-03-03
    • 1970-01-01
    相关资源
    最近更新 更多