【问题标题】:Are there techniques to omit certain text from web crawlers是否有技术可以从网络爬虫中省略某些文本
【发布时间】:2023-04-06 04:50:02
【问题描述】:

现在,我的使用条款通过 ascx 控件加载,并在用户需要或想要查看时显示为 w/jquery...我喜欢这个 UX,因为我可以在jquery 弹出我控制而不重定向用户。

问题是谷歌已经注意到了这一点,因为它是由 ascx 作为静态文本加载的。我知道我可以把它放在一个新页面中并重定向(并向robots.txt添加一个忽略规则),但我的问题是,如果我只在需要显示这个文本时才使用ajax异步加载它,谷歌的网络爬虫点击每个链接,仍然将所有这些合法文本归于页面(并继续搞砸我的 seo 结果)。

在我尝试这种技术之前,我想知道是否有人 1) 有任何其他他们使用的技术或 2) 知道这种技术是否最终会奏效。 Google 需要几天时间才能将我的网站编入索引,所以如果有人确切知道,我不想浪费时间。

请注意,我发现的唯一相关问题是here,但这个人试图对网络爬虫进行恶意攻击。我只希望 robots.txt 在不影响我的用户体验的情况下忽略行为。

【问题讨论】:

    标签: jquery asp.net seo web-crawler


    【解决方案1】:

    您可以做的一件事是仅在用户代理(即用户的浏览器)不是 Googlebot 时显示您的使用条款。

    在 ASP.NET 中,您可以通过检查 Request.ServerVariables("HTTP_USER_AGENT") 来验证浏览器。

    Google 报告以下用户代理:

    Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
    

    所以,只需用支票包装您的内容,如下所示:

    if (! Request.ServerVariables("HTTP_USER_AGENT").Contains("Googlebot"))
    {
         <your content here>
    }
    

    祝你好运!

    【讨论】:

    • 哦,是的,这就是我要找的!谢谢!
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-01-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多