根本原因是蜘蛛默认只取document.body.innerhtml的初始html字符串,而动态内容依赖fetch或react.render等后续js注入,导致原始响应为空;百度、google虽支持有限js执行但超时极低(≤5秒),且不触发用户事件、不处理跨域失败请求。

动态页面为什么蜘蛛抓不到内容
根本原因不是“蜘蛛不执行 JavaScript”,而是它默认只取 document.body.innerHTML 的初始 HTML 字符串——如果关键内容靠 fetch() 或 React.render() 后续注入,原始响应里就是空的或只有占位符。百度、Google 的爬虫虽支持有限 JS 执行,但超时阈值极低(通常 ≤5 秒),且不等 setTimeout、不触发用户事件、不处理跨域失败的请求。
常见错误现象:view-source: 里看不到正文文本;Lighthouse 报 “Content is not crawlable”;百度站长平台显示“抓取成功但索引量为 0”。
- 服务端未返回首屏 HTML,全靠前端渲染(CSR)
- API 请求带登录态或 referer 校验,爬虫发请求直接 401/403
- 使用了
history.pushState但没配canonical,导致 /page/1 和 /page/1?utm=xxx 被当两个页面
SSR 或预渲染是唯一可靠解法
静态生成(如 Astro、Next.js)、服务端渲染(如 Nuxt、Remix)或静态预渲染(prerender-spa-plugin)能保证每个 URL 返回含完整文本的 HTML。这不是“可选优化”,而是动态内容被收录的前提。
实操建议:
- 若用 Vue/React,优先选
ssr: true模式而非纯 CSR;Next.js 中确保getServerSideProps或generateStaticParams覆盖所有路由 - 无法改架构?用 Puppeteer 做轻量预渲染:对关键路径(如 /blog/:id)启动无头浏览器,保存渲染后 HTML,Nginx 直接返回该文件
- 避免“伪 SSR”:在 Node 层只吐个
<div id="root"></div>+script,和 CSR 无异
meta robots 和 canonical 必须每页动态写死
meta name="robots" 控制是否允许索引,link rel="canonical" 告诉爬虫“这个 URL 才是权威源”。两者都必须随路由参数实时生成,不能模板里硬编码。
如果你了解HTML,CSS和JavaScript,您已经拥有所需的工具开发Android应用程序。本动手本书展示了如何使用这些开源web标准设计和建造,可适应任何Android设备的应用程序 - 无需使用Java。您将学习如何创建一个在您选择的平台的Android友好的网络应用程序,然后转换与自由PhoneGap框架到一个原生的Android应用程序。了解为什么设备无关的移动应用是未来的潮流,并开始构建应用程序,提供更
典型翻车点:
- 所有页面共用
<meta name="robots" content="index, follow">—— 但搜索页、登录页、测试页本该加noindex -
canonical写成相对路径/article/123,而实际访问的是https://example.com/article/123?ref=share,导致权重分散 - SPA 路由切换时没更新
canonical,页面内容变了但href还是上一页的 URL
正确写法示例(Next.js App Router):
export async function generateMetadata({ params }) {
const post = await getPost(params.id);
return {
title: post.title,
alternates: { canonical: `https://example.com/blog/${post.id}` }
};
}
避免让爬虫浪费配额在无意义请求上
百度/Google 对动态页面的抓取成本更高(消耗 3–5 倍配额)。若页面带大量无效查询参数、未过滤的 tracking 参数、或返回 200 的空数据接口,会快速耗尽每日抓取限额。
必须做三件事:
- URL 标准化:Nginx 层用
if ($args ~* "utm_|ref=|fbclid") { rewrite ^(.*) $1? permanent; }清洗参数 - API 接口加
X-Robots-Tag: noindex响应头,防止爬虫误抓 JSON - 动态分页加
rel="next"/rel="prev",但仅限真实内容分页;不要给“加载更多”按钮的 AJAX 接口配这些标签
最易被忽略的一点:爬虫不会等你“滚动加载”或“点击展开”。所有核心内容必须在首屏 HTML 中存在,否则等于不存在。
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!










