【发布时间】:2011-04-22 20:41:25
【问题描述】:
我的日志已满:
2011-04-22 13:30:02.251 /soc/content/images/melange-logo.jpg 404 0ms 0cpu_ms 0kb facebookexternalhit/1.0 (+http://www.facebook.com/externalhit_uatext.php),gzip(gfe),gzip(gfe),gzip(gfe) 69.171.224.250 - - [22/Apr/2011:13:30:02 -0700] “获取 /soc/content/images/melange-logo.jpg HTTP/1.1" 404 0 - “facebookexternalhit/1.0 (+http://www.facebook.com/externalhit_uatext.php),gzip(gfe),gzip(gfe),gzip(gfe)" “www.google-melange.com” ms=1 cpu_ms=0 api_cpu_ms=0 cpm_usd=0.000036 W 2011-04-22 13:30:02.250 静态文件 未找到处理程序引用: soc/content/melange-logo.jpg
这是一个已知的 404,我们更改了 url 架构并且不再使用该链接。我很满意它提供 404。我不满意的是每次 Facebook 的机器人点击该 url 时我的日志中的 警告,它大约每 5 分钟执行一次,污染了我的日志。
我怎样才能摆脱这个烦人的警告?
app.yaml 位于:
http://code.google.com/p/soc/source/browse/app/app.yaml.template
【问题讨论】:
-
为什么不在您的 robots.txt 中禁止该特定文件?
-
A 并不意味着刻薄,但是将一个 URL 添加回您的应用程序以获得“旧版”支持是否会更容易?我想您还可以为该 URL 编写一个不返回错误代码的自定义处理程序。
-
我想这是一个选项,但并不是我的问题的真正答案。困扰我的主要事情是,有人可以通过访问碰巧与我的静态文件正则表达式匹配的随机 url 向我的日志发送垃圾邮件。
-
查看日志中反映的实际或潜在站点问题的好处是否超过了日志中垃圾邮件的风险?如果有人恶意向您发送垃圾邮件,请使用黑名单工具。否则,我会说这些日志是一件好事。您可以随时下载日志并解析噪音。