【发布时间】:2019-11-25 20:34:50
【问题描述】:
我在网站的不同文件夹中有大量 PDF 文件。我需要防止它们被 Google 使用 .htaccess 编入索引(因为 robots.txt 显然不会阻止在其他页面链接到文件时编入索引)。
但是,我尝试将以下内容添加到我的 .htaccess 文件中:
<Files ~ "\.pdf$">
Header append X-Robots-Tag "noindex, nofollow, noarchive, nosnippet"
</Files>
无济于事;谷歌搜索“site:mysite.com pdf”时,PDF 文件仍会显示,即使我已要求 Google 重新索引该网站。
我无法选择将文件托管在别处或使用登录系统保护它们;我真的很想简单地获取 htaccess 文件来完成这项工作。我错过了什么?
【问题讨论】:
-
我不认为这是正确的答案,但我想你可以使用重写规则来匹配谷歌用户代理并将它们重定向到 404 页面。此外,您是否验证了访问您网站上的 PDF 网址实际上会在响应中返回 X-Robots-Tag HTTP 标头?最后,当要求谷歌重新索引时,您是否在您的 access_log 中确认他们确实重新索引了您并点击了那些 PDF 网址?