【问题标题】:How google (and other SEs) find pages for web crawlers to index?谷歌(和其他 SE)如何查找网页供网络爬虫索引?
【发布时间】:2015-12-12 16:11:37
【问题描述】:
当你构建一个网络爬虫时,你定义了一个页面url,它贯穿这个页面和这个页面上的所有链接等等。
但是搜索引擎索引了什么?我的意思是,他们不能只在 url 中打印万维网,所有网站都将被抓取......
那么基本上他们在爬什么?
另外我也想知道,如果我爬取一个网站,会不会被认为是DOS攻击呢?
我没有恶意,我只是想收集信息。那么我应该担心被指责为发起拒绝服务攻击的人吗?
【问题讨论】:
标签:
search
web-crawler
search-engine
【解决方案1】:
每个搜索引擎都有一组不同的索引。如果我们知道我们将没有 SEO 行业。通常他们会查看显示的文本、元数据、标题和 Alt 属性。基于标记和样式的文本具有不同的优先级 - 因此 H1 标记会为其内容添加权重,使其被认为是更强的匹配。
抓取网站不是 DoS,除非您可能来自许多客户的许多重复且不必要的请求。
此外,抓取过程与您提到的完全一样。 URL 由网站所有者作为起点提交。然后抓取任何链接 - 经常重新访问页面以更新新内容。大多数网站都会包含一个 robots.txt 文件来告诉爬虫它可以查看什么。由爬虫的开发者决定他们是否尊重它。