【问题标题】:Different page provided for Google Crawl为 Google 抓取提供了不同的页面
【发布时间】:2009-06-24 19:06:41
【问题描述】:

我已经构建了一个只有一页的 Twitter 客户端:index.html。使用时,它会从 JSON 提要中提取内容以填充各种列。问题是几乎没有任何流量来自谷歌,除了对网站域名的搜索。这是因为 Google 只会在 index.html 为空且用户输入任何要查找的 Twitter 用户名之前抓取 index.html。

我如何让 Google 蜘蛛在尝试抓取 index.html 而不仅仅是 index.html(或另外)抓取时还说 index.html#CNN(即 site.com/#CNN)或 index.html #whitehouse,这些页面中的所有内容也将被抓取,因此用户可以通过其中的术语进行搜索。

【问题讨论】:

  • 如果您还不知道,google bot 不会在您的页面上运行 javascript。
  • Google 不能很好地索引 100% AJAX 网站。如果您想依靠 google 获得流量,您将不得不硬着头皮决定采用稍微不那么以 AJAX 为中心的设计。

标签: apache .htaccess seo apache-config


【解决方案1】:

我认为 Google 永远不会在其索引中包含片段 (#)。 您应该提供备用网址,例如 site.com/CNN

【讨论】:

  • 这里的问题是我不希望这样的页面被这样命名,因为一旦用户离开 CNN,它就不会反映页面的内容。但是,它可能是唯一的选择。
【解决方案2】:
  • 使用站点地图来说明 Google 的选项。
  • 嵌入隐藏链接以便 Google 知道去那里查看?
  • 使用单独的页面列出一些“示例”。可能是您的用户和 Google 的混合体...

【讨论】:

  • 站点地图可能有效,但主页上已经有一个指向 site.com/#testuser 的链接(存在一些“示例”,但仅在从文本文件中提取内容的 div 中)在浏览器中加载时(不是爬虫?))来自 site.com/#testuser 的内容不会被爬取。
猜你喜欢
  • 1970-01-01
  • 2022-01-21
  • 2016-10-18
  • 2012-07-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多