meta name="robots" 标签完全不控制抓取频次,仅建议索引与链接跟踪行为;真正影响频次的是cache-control响应头、sitemap.xml中的及robots.txt中sitemap声明。

meta name="robots" 标签完全不控制搜索引擎抓取频次——它连“要不要抓”都只是建议,更别说“多久抓一次”。想调频,得去改服务器响应头、sitemap.xml 或 robots.txt。
为什么 meta name="robots" 对抓取频率无效
爬虫行为分两步:先读 robots.txt 决定“进不进门”,再解析 HTML 里的 meta name="robots" 决定“进门后干啥”。这个标签只影响索引和链接跟踪(如 noindex、nofollow),没有时间字段,也不传递更新信号。
Google 明确说明:changefreq 在 sitemap.xml 中也只是建议,meta 根本没这个字段。实测中所有试图靠反复写 content="index,follow" “催促”爬虫的行为,均无效果,部分还触发风控识别为异常页面。
meta name="robots" 写错一个字符就等于没写
它不强制,但生效门槛极高。拼写、大小写、逗号空格全要精准:
-
name必须是robots(小写,不能是Robots或ROBOTS) -
content值之间用英文逗号分隔,不能有中文逗号或空格,比如noindex, nofollow中的空格会让部分爬虫忽略后半段 -
none是noindex,nofollow的简写,但不是所有爬虫都支持;all同理,不如显式写index,follow - 必须放在
内,且不能被 JS 动态注入(SSR 必须预渲染)
真正影响抓取频次的三个可操作点
抓取节奏由服务端信号驱动,不是靠 HTML 里喊话:
-
Cache-Control: max-age=300响应头:对高频更新页(如新闻列表),设短缓存(5 分钟),向爬虫传递“内容易变”信号 -
sitemap.xml中的<lastmod></lastmod>:必须精确到秒(如2026-06-13T15:12:00+00:00),且与 HTTPLast-Modified响应头严格一致 -
robots.txt显式声明Sitemap:地址:例如Sitemap: https://example.com/sitemap.xml,否则爬虫可能根本不去读你的 sitemap
容易被忽略的是:即使你把 meta name="robots" 配得再准,只要 Cache-Control 返回 max-age=31536000(一年),爬虫就会默认你这页“几乎不变”,后续回访间隔拉长到数周甚至数月。











