【发布时间】:2015-07-23 10:19:56
【问题描述】:
我有一个能够为各种网络应用程序的资产提供服务的网络服务器。当请求的资产不存在时,它会发回 index.html。换句话说:
- GET /img/exists.png -> exists.png
- GET /img/inexistent.png -> index.html
这也意味着:
GET /robots.txt -> index.html
谷歌(和其他)抓取工具将如何处理这个问题?他们会检测到 robots.txt 无效并忽略它(与返回 404 相同)吗?或者他们会因为提供无效的 robots.txt 而对我的排名进行处罚?这是可以接受的,还是我应该在我服务的应用没有 robots.txt 的情况下返回 404?
【问题讨论】:
-
资源不存在时为什么不返回404状态?这是您自己的选择,还是出于您无法控制的原因而坚持这样做?
-
@plasticinsect 最初是为了支持单页应用。因此,除了资产之外的任何东西都可能成为应用程序部分的路径。如果您请求 /home,它会提供 index.html 并显示主视图。如果您请求 /about,它会提供 index.html 并显示 about 视图。我们不想列出详尽的路由列表,因为它实际上是一个能够为任何应用程序提供服务的通用服务器......(一如既往,问题的 stackoverflow 版本被简化了)我们正在为此制定更好的模式,但现在这就是我们所拥有的,它必须工作......
标签: robots.txt google-crawlers