最可靠页面级屏蔽方式是直接在html的中添加,它被主流搜索引擎识别,且不依赖服务器配置;需确保该标签真实存在于源码中、位置靠前、非js动态插入,并配合gsc验证索引状态。

直接在里加<meta name="robots" content="noindex, nofollow">就行
这是最常用、最轻量、也最可靠的页面级屏蔽方式。它不依赖服务器配置,不改URL结构,只要 HTML 被爬虫下载到,指令就生效。Google、Bing、Yandex 等主流引擎都识别 name="robots",且明确支持 noindex, nofollow 组合。
注意:noindex 不等于“禁止爬取”——爬虫仍会请求该页面(否则看不到这个 meta),但它看到后就不会把页面放进搜索结果;nofollow 则进一步阻止它顺着你页面里的链接继续爬下去。
- 必须放在
内,且越靠前越好(避免被构建工具过滤或 JS 动态覆盖) - 不能用 JS 插入,比如
document.write()或innerHTML,因为爬虫基本不执行 JS - 某些构建流程(如
html-webpack-plugin)默认会删掉不认识的meta标签,上线前务必检查生成的 HTML 源码里是否真实存在
content 值选错会导致意外收录或权重泄漏
常见组合不是随便拼的,每个值都直接影响索引行为和链接权重传递:
-
noindex, follow:页面不被收录,但你页面上的所有链接(包括跳转入口、文档引用、内部导航)仍会被爬虫跟踪并传递权重——适合 A/B 测试页、带跳转按钮的登录页 -
noindex, nofollow:完全隔离,既不进搜索结果,也不让爬虫顺藤摸瓜——适合后台入口、表单提交成功页、临时活动页 -
noindex(单独写):等价于noindex, follow,是默认行为,别以为省了follow就更安全 -
none:虽是noindex, nofollow的简写,但部分旧爬虫或监控工具不识别,建议显式写全 - 别混用冲突值,比如
noindex, index或follow, nofollow,爬虫会直接忽略整条 meta
为什么不用 robots.txt 禁止抓取 /index.html?
robots.txt 是路径级规则,只管“能不能访问”,不管“访完怎么处理”。一旦其他网站外链指向你的 index.html,即使 robots.txt 写了 Disallow: /index.html,搜索引擎仍可能仅凭 URL 和锚文本生成一个“幽灵页面”(Ghost Page)出现在搜索结果中。
-
robots.txt屏蔽后,爬虫根本不会下载 HTML,也就读不到你写的noindex—— 两者同时用反而让noindex失效 - 想彻底防收录,必须用页面级指令,也就是
<meta name="robots"> -
robots.txt更适合屏蔽资源目录(如/uploads/)、脚本路径(如/cgi-bin/)这类不该被爬的非 HTML 内容
上线后最容易被忽略的三个验证点
改完代码不等于生效。缓存、CDN、服务端渲染漏配,都会让爬虫看到旧版本。
- 用隐身窗口直接请求完整 URL,右键“查看网页源代码”,确认
<meta name="robots" content="noindex, nofollow">真实存在且拼写无误(注意空格、逗号、引号) - 清空 CDN 缓存和反向代理缓存,尤其是 Nginx 或 Cloudflare 上的页面级缓存规则
- 用 Google Search Console 的「URL 检查」工具输入地址,看「索引状态」是否为「已排除:已标记为 noindex」——这比看源码更权威,因为它模拟的是 Googlebot 实际看到的内容
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











