【问题标题】:My website is not crawled by google我的网站没有被谷歌抓取
【发布时间】:2017-02-13 13:36:18
【问题描述】:

我网站中的一些页面是使用 KnockoutJS(ajax JS 框架)实现的

由于某些原因,这些页面未被 Google 抓取

未编入索引的页面:

fidelite.kz/#!product_info/1 fidelite.kz/#!product_info/2 fidelite.kz/#!product_info/3 ... fidelite.kz/#!product_info/183

网站有这些页面的静态副本:

fidelite.kz/?_escaped_fragment_=product_info/1 fidelite.kz/?_escaped_fragment_=product_info/2 fidelite.kz/?_escaped_fragment_=product_info/3 ... fidelite.kz/?_escaped_fragment_=product_info/183

网站地图:

fidelite.kz/sitemap.txt

请访问该页面 fidelite.kz/#!product_info/2 已编入索引,因为此页面是通过 google 网站管理员搜索控制台手动添加的。 以这种方式添加所有页面耗时太长。

谷歌网站管理员搜索控制台中没有显示错误。

如何强制根据sitemap.txt索引的所有页面?

谢谢

【问题讨论】:

    标签: javascript ajax knockout.js web-crawler google-crawlers


    【解决方案1】:

    这一切都让我感到畏缩。

    'fidelite.kz/#!product_info/1' 不是页面 fidelite.kz 是页面,'#!product_info/1' 是页面的部分。

    Google 会看到 # 而不会将其作为另一个页面编入索引。

    我建议在您设计和开发任何电子商务网站时考虑可索引性。如果不是您做的,请向您的客户建议这是一个问题,网站重新设计是一个很好的解决方案。

    【讨论】:

    • 是的,我确实读过,很棒的故事。请对 HTTP URL 结构以及它与 Google 的网页索引有何关系进行一些研究。
    • @Alexey:Google 不应该看到 # 之后的部分。如果您设法欺骗 Google 获取该页面,那么这是 Google 爬虫中的一个错误。这是因为 url 中不存在 # 之后的部分,浏览器永远不会将其发送回服务器,这意味着 Google 也不应该这样做。浏览器将 # 之后的部分视为 html 中元素的 id(可能是 div 或 span 或 table,通常是 h1、h2 或 h3)
    • @slebetman 你听说过单页网站吗?你知道这些网站也能被谷歌收录吗?
    【解决方案2】:

    如果google搜索引擎没有抓取到你的网站会有以下原因:

    1. 请检查机器人元标记“noindex tag”
    2. 检查 robots.txt 文件“禁止:/”

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-03-09
      • 2018-07-12
      • 1970-01-01
      • 2015-05-26
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-04-12
      相关资源
      最近更新 更多