【问题标题】:How google (and other SEs) find pages for web crawlers to index?谷歌(和其他 SE)如何查找网页供网络爬虫索引?
【发布时间】:2015-12-12 16:11:37
【问题描述】:

当你构建一个网络爬虫时,你定义了一个页面url,它贯穿这个页面和这个页面上的所有链接等等。 但是搜索引擎索引了什么?我的意思是,他们不能只在 url 中打印万维网,所有网站都将被抓取...... 那么基本上他们在爬什么?

另外我也想知道,如果我爬取一个网站,会不会被认为是DOS攻击呢? 我没有恶意,我只是想收集信息。那么我应该担心被指责为发起拒绝服务攻击的人吗?

【问题讨论】:

    标签: search web-crawler search-engine


    【解决方案1】:

    每个搜索引擎都有一组不同的索引。如果我们知道我们将没有 SEO 行业。通常他们会查看显示的文本、元数据、标题和 Alt 属性。基于标记和样式的文本具有不同的优先级 - 因此 H1 标记会为其内容添加权重,使其被认为是更强的匹配。

    抓取网站不是 DoS,除非您可能来自许多客户的许多重复且不必要的请求。

    此外,抓取过程与您提到的完全一样。 URL 由网站所有者作为起点提交。然后抓取任何链接 - 经常重新访问页面以更新新内容。大多数网站都会包含一个 robots.txt 文件来告诉爬虫它可以查看什么。由爬虫的开发者决定他们是否尊重它。

    【讨论】:

      猜你喜欢
      • 2013-10-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-11-23
      相关资源
      最近更新 更多