必须存在且唯一,是google移动优先索引的内容锚点,决定正文识别、内链权重分配与h1主题认定;缺失或重复会导致爬虫误抽备案号等非主体内容,引发真实流量断崖。

main 必须存在且唯一,否则 Google 移动优先索引会从 footer 里抽备案号当主内容——这不是理论风险,是真实发生过的流量断崖案例。
为什么千万级流量站点必须用 main 而不是靠 class 模拟
爬虫不解析 CSS 或 JS,只依赖 DOM 结构做首屏内容提取。main 是 Google 移动优先索引的「内容锚点」:它决定哪段 HTML 被视为正文、哪些链接被计入内链权重、h1 是否被认可为页面主题。不用 main,等于把 SEO 控制权交给爬虫的启发式猜测。
- SPA 项目中,服务端渲染(SSR)输出的 HTML 必须包含真实可索引内容在
main内,不能只是<main><div id="root"></div></main> -
main不能嵌套在header、aside或section里,否则会被忽略 - 多个
main标签会导致爬虫降权,部分 CDN 缓存层会直接拒绝该页面参与搜索收录
article 和 section 的边界在哪?错用直接拉低长尾词覆盖
article 表示可独立分发、复用的内容单元(如一篇博客、一条新闻),section 只是按主题划分的逻辑区块,无独立语义价值。混用会让爬虫误判内容重复性或弱相关性。
- 单页含多篇博客?每篇必须用独立
article包裹,且各自带h1或h2+time元素 - “原理”“实操”“对比”这类模块,用
section+ 对应层级标题(h2起始),不能全塞进一个section -
section内没有标题,等于告诉爬虫“这段没重点”,可能被跳过索引 - 装饰性图片必须写
alt="",否则被识别为缺失内容,触发结构异常标记
figure+figcaption 是图文长尾词覆盖的关键开关
单独给 img 加 alt 是基础;把图和说明一起放进 figure,搜索引擎才会联合分析图像内容与 figcaption 文本,显著提升长尾词覆盖(例如 <figcaption>React Server Components 渲染流程对比图</figcaption>)。
-
figcaption必须是figure的第一个或最后一个子元素,中间插其他标签会破坏语义关联 -
figure不仅用于图片,也适用于带说明的代码块、数据图表、视频片段 - 避免堆砌关键词:
alt和figcaption需自然描述,否则触发 spam 判定
真正难的不是记住标签名,而是每次写 HTML 前先问一句:“如果关掉所有 CSS,这个结构还能让爬虫和屏幕阅读器准确说出‘这是什么’吗?”——千万级流量站点的容错率极低,语义偏差 1%,可能就是万级 UV 的流失。
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











