核心是确认robots.txt未用disallow错误拦截首页、栏目页等内容路径,需人工核对user-agent: *下的规则,检查关键url是否被前缀匹配屏蔽,并用百度/夸克平台工具及curl命令交叉验证。

检查 robots 协议是否误禁关键目录,核心是确认 robots.txt 文件中没有用 Disallow 错误拦截本该被爬虫访问的路径,比如首页、栏目页、内容页等。重点不是“有没有 robots.txt”,而是“它实际放行了哪些路径”。
直接访问并人工核对 robots.txt 内容
在浏览器地址栏输入 你的域名 + /robots.txt(例如 https://example.com/robots.txt),回车打开。观察返回内容是否为纯文本,且包含明确的规则块。
- 查找
User-agent: *段落——这是影响所有主流爬虫(含百度、夸克、Google)的通用规则 - 检查其下的
Disallow行:若出现Disallow: /,整站被禁止;若出现Disallow: /article/或Disallow: /list,对应栏目或内容路径即被屏蔽 - 注意通配符写法:
Disallow: /admin会同时封掉/admin/和/admin-login;而Disallow: /admin/(末尾带斜杠)才只封子目录
验证关键路径是否在允许范围内
挑出你最希望被收录的几个 URL(如首页 /、最新文章页 /post/abc、分类页 /category/news),逐个判断它们是否落在 Disallow 规则覆盖内。
- 用纸笔或表格列出每个路径,对照
robots.txt中每条Disallow规则,看是否被前缀匹配 - 特别注意参数路径:如
Disallow: /search会封掉/search?q=ai,但不会封/search-result - 如果用了
Allow规则,要确认它是否能覆盖在更宽泛的Disallow之后(部分爬虫支持,但非全部;优先靠Allow精确放行)
排查针对特定爬虫的单独限制
有些网站为兼容不同引擎,会为特定 User-agent 单独写规则,容易遗漏或冲突。
- 搜索
User-agent: Baiduspider、User-agent: QuarkSpider、User-agent: Googlebot等段落 - 若存在,检查其下方是否有
Disallow: /或Disallow: /news类规则——这会专门屏蔽该爬虫,其他爬虫不受影响 - 若只有
User-agent: *规则,而没写具体爬虫段,则所有爬虫都走通用规则,无需额外担心
用工具辅助验证实际生效效果
人工阅读易漏细节,建议配合工具交叉验证:
- 百度搜索资源平台 →「robots.txt 分析工具」:可模拟 Baiduspider 解析,标出被拦的具体路径
- 夸克站长平台 →「Robots 检测」:专查 QuarkSpider 是否被
Disallow: /或User-agent: QuarkSpider拦截 - 命令行快速测试:
curl -I https://yourdomain.com/important-page.html查响应头,确认没被X-Robots-Tag: noindex覆盖(该头优先级高于 robots.txt)
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











