【问题标题】:What User-Agent should I use when crawling sites using own program使用自己的程序抓取网站时应该使用什么用户代理
【发布时间】:2018-09-10 11:42:55
【问题描述】:

我用 node.js 做了爬虫。我想每小时抓取一些网站。

我试图找出我应该使用什么用户代理,但我只得到了像 google bot 和 bing bot 这样的结果。我不知道我是否可以使用这些用户代理。

您能告诉我应该使用哪个用户代理吗?

【问题讨论】:

    标签: http http-headers user-agent


    【解决方案1】:

    由于您制作了自己的爬虫,因此您可以想出自己的名字。没有关于 UserAgent 可能是什么的规则,但许多使用像 name/version 这样的格式,比如:

    myAwesomeCrawler/1.0
    

    您还可以包含一个网址,以便网站所有者在您的日志中看到有关您的机器人的更多信息:

    myAwesomeCrawler/1.0 (http://example.org)
    

    但最终取决于你。

    当然,这一切都取决于您所做的事情不违法或违反您正在抓取的网站的服务条款。

    【讨论】:

      【解决方案2】:

      取决于您想要实现的目标。如果你想模仿一个合法的浏览器,只需使用 Chrome 或 Firefox 等常见浏览器的用户代理。如果您想告诉网站您是爬虫,只需使用您定义的内容(例如 xyzCrawler)。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2014-03-12
        • 1970-01-01
        • 2018-06-22
        相关资源
        最近更新 更多