【问题标题】:How google crawler find each and every page over the internet谷歌爬虫如何在互联网上找到每个页面
【发布时间】:2016-06-07 04:46:49
【问题描述】:

今天我有一个问题,谷歌爬虫如何在抓取过程中找到互联网上的每一页,如果你有答案,请分享给我。

如果您对此有更多需要,请查看以下链接。

HOW SEARCH WORKS

提前谢谢!!!!

【问题讨论】:

  • 让我直截了当地说:您已阅读所有您共享的链接中的信息,并观看了它提供的所有视频,但您仍然不明白如何有用?我不认为我们可以帮助你。另外,这个问题似乎根本不是关于编程的,或者太宽泛了。
  • 是的,但是没有关于如果你从零开始你是如何在互联网上对数万亿个文档进行爬网的规范,是的,这个问题与编程无关,所以我不在这里分配编程语言标签发布...谢谢...
  • Crawling & Indexing 页面的“通过抓取查找信息” 部分的第二段:抓取过程从过去抓取的网址列表开始 *和sitemaps 由网站所有者提供*。当我们的爬虫访问这些网站时,他们会寻找其他页面的链接以访问...

标签: google-crawlers


【解决方案1】:

抓取是存储缓存数据的过程,搜索引擎在缓存数据中寻找超链接,可能是文本或图像超链接。然后在找到一个之后,它会打开该页面进行缓存并开始在其中查找链接。该过程一直持续到找不到更多链接为止。

因此,在这个长长的超链接链中,几乎可以肯定大部分互联网都包含在内。但是,这并不意味着它已经抓取了所有内容。 由于缺少指向它的链接,许多新网站都被排除在外。 还有一些网站没有被抓取,因为它们不打算被发现。

【讨论】:

  • 谢谢@Shashikant_ 那么这个过程是从一个特定页面开始的,它爬取了大部分互联网页面吗??
  • 是的。但是,也有一些系统需要手动或优先级来请求抓取,如果您有一个新网站,您需要手动提交页面以加快抓取过程,或者搜索引擎可能需要数天有时数月才能到达您的网站网站。
  • 感谢您的回答哥们,这意味着爬取数据库的大小会随着时间的推移而增加,并且在爬得更好后我们会得到更好的结果...
猜你喜欢
  • 2021-09-13
  • 2013-10-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-04-14
  • 1970-01-01
  • 2013-10-15
相关资源
最近更新 更多