noindex会彻底屏蔽快照,因搜索引擎跳过索引流程,无索引则无快照;即使原有快照,也会在数小时至两天内下线,故需保留快照时严禁使用noindex。

noindex 会直接让快照消失,不是“隐藏”或“延迟”,而是跳过整个索引流程——所以想保留快照,就绝不能加 noindex。
noindex 为什么会让快照彻底失效
搜索引擎收到 <meta name="robots" content="noindex"> 后,不会把页面加入索引库,也就没有“被索引的 URL”这个前提。快照是索引后的副产品,没索引 = 没快照。即使页面之前有快照,加上 noindex 后通常几小时到两天内就会下线。
常见误操作包括:
- 在分页页(如
/blog?page=2)加noindex,结果整组内容失去快照入口 - Staging 环境只加
noindex却没配nofollow,爬虫顺着链接爬进生产环境,但 staging 页本身快照已清空,无法回溯调试 - 用
noindex, follow以为“还能传权重”,却忽略了用户点搜索结果里的“缓存”链接时,看到的是空白或 404
noarchive 是唯一能保留索引但禁快照的配置
noarchive 的作用很明确:允许收录、参与排名,但禁止生成和展示快照。它不干扰索引流程,只干预存储环节。
适用场景有限但关键:
- 金融类页面含实时利率/股价,怕快照过期误导用户
- 法律条款页频繁更新,旧快照可能引发合规争议
- 电商 SKU 页价格变动频繁,不希望用户看到过期促销信息
注意:noarchive 对 Google 有效,但 Bing 和 Yandex 不一定支持;且它不能替代 noindex——如果页面本就不该被搜到,noarchive 毫无意义。
SPA 页面里 meta robots 根本不生效
React/Vue 路由页返回的初始 HTML 通常是空壳,<meta name="robots"> 在 JS 渲染后才注入。爬虫不执行 JS,源码里搜不到该标签,指令完全丢失。
必须改服务端逻辑:
- 根据请求 URL 路径,在 HTTP 响应头中返回
X-Robots-Tag: noindex或X-Robots-Tag: noarchive - 避免 CDN 缓存带
X-Robots-Tag: noindex的响应——否则撤掉指令后,快照恢复要等缓存过期 - PDF、JSON API、图片等非 HTML 资源,只能靠
X-Robots-Tag控制,<meta>标签压根无效
robots.txt 和 meta robots 别混着用
robots.txt 控制“能不能抓”,<meta name="robots"> 控制“抓了之后怎么处理”。两者不是同一层机制:
- 如果
robots.txt里写了Disallow: /admin/,爬虫根本不会发请求,<meta>标签再全也没人读 - 如果只靠
<meta name="robots" content="noindex">保护后台登录页,但robots.txt放行/admin/,爬虫仍会抓取该页并看到敏感路径结构 - 关键页面务必双保险:
robots.txt屏蔽路径 + 页面 HTML 中写<meta name="robots" content="noindex,nofollow">
快照问题最常出在“以为加了 meta 就万事大吉”,其实服务端响应头、CDN 缓存、爬虫是否执行 JS、甚至页面是否真被索引——这些环节漏一个,快照行为就不可控。
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











