【问题标题】:Do spiders only crawl the urls in sitemap [closed]蜘蛛是否只抓取站点地图中的网址 [关闭]
【发布时间】:2014-10-29 19:53:31
【问题描述】:

我的网站上有一些限制部分供蜘蛛抓取。

引用仅包含我希望蜘蛛索引的 url 的 sitemap.xml 文件是否足够?

或者我应该将以下元标记添加到我想限制访问的页面?

<meta name="robots" content="NONE,NOARCHIVE" />

【问题讨论】:

  • 这个问题似乎是题外话,因为它是关于 SEO

标签: web seo web-crawler sitemap robots.txt


【解决方案1】:

页面不必列在要抓取的 XML 站点地图中。蜘蛛会爬行它们能找到的任何东西。如果您想阻止某个页面被抓取,您需要使用 robots.txt 文件来阻止它。

您不希望某个页面出现在搜索引擎的搜索结果中,您需要使用x-robots-tag 明确阻止他们这样做。仅仅阻止页面被抓取是不够的Google may still list a page it can't crawl if it deems that page is important and should be in its search results

您可以使用元标记:

<meta name="googlebot" content="noindex">

或 HTTP 标头:

X-Robots-Tag: noindex

【讨论】:

    【解决方案2】:

    您应该在 robots.txt 中“禁止”那些您不希望蜘蛛抓取的页面。蜘蛛甚至不会加载这些页面,更不用说索引它们了。在这里阅读:http://www.robotstxt.org/

    如果您希望蜘蛛读取页面但不将它们编入索引,则添加“noindex”标签,如下所示:

    <meta name="robots" content="noindex">
    

    爬虫肯定会爬取和索引不在 sitemap.xml 中的页面

    【讨论】:

    • 如果我不希望蜘蛛读取或索引我网站的某个部分?
    • robots 文件可以阻止爬虫通过文件夹读取您网站的某个部分。像“禁止 /private”,它不会读取任何带有以 /private 开头的 url 的文件。一旦你这样做了,页面上的标签就无关紧要了——因为爬虫再也看不到标签了。
    • 当您希望爬虫通过非索引页面读取时,可以使用诸如“noindex”之类的标签。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-11-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-12-12
    • 2012-01-23
    相关资源
    最近更新 更多