ansible任务卡死通常因网络、权限、主机失联、模块超时或远程命令阻塞所致,需分层定位:先用-vvv看卡在ssh连接还是模块执行,再查dns解析、ssh连通性、受管端进程/i/o/内存,结合模块特性(如shell交互、copy写入、service依赖)针对性排查。

Ansible 任务执行卡死无响应,通常不是“程序挂了”,而是被某个环节阻塞住了——可能是网络不通、权限卡住、目标主机失联、模块等待超时,或是远程命令本身卡在系统调用里。关键在于分层定位:先确认是控制端没发出去,还是受管端没收到/没返回。
看控制端是否真正发起执行
运行 Ansible 命令后长时间没输出,先检查它是否卡在本地解析或连接准备阶段:
- 加 -vvv 参数重试(如
ansible all -m ping -vvv),观察日志停在哪一步:如果卡在ESTABLISH SSH CONNECTION或Using module file,说明还没连上目标机; - 检查 inventory 中主机名/IP 是否可解析:
ping -c1 target-host、nslookup target-host; - 确认 SSH 连通性:
ssh -o ConnectTimeout=5 user@target-host -v,看是否卡在密钥认证、密码提示或连接建立阶段。
查受管端是否已接收但未返回
如果控制端日志显示已成功建立 SSH 连接并上传了临时脚本,但一直没回结果,问题大概率在受管端:
- 登录目标主机,用
ps aux | grep ansible查是否有残留的 Python 进程(尤其是/tmp/ansible_*脚本)正在运行或僵死; - 检查磁盘 I/O 是否打满:
iostat -dx 1看%util和await是否异常高——Ansible 模块(如copy、template)在写大文件或同步大量内容时,可能被慢盘拖住; - 检查内存是否耗尽触发 OOM:
dmesg -T | tail -20找Out of memory: Kill process记录,Ansible 的 Python 进程可能被杀而没来得及上报。
盯住具体模块的行为特征
不同模块卡死原因差异很大,需结合用途判断:
-
shell / command 模块:最常见卡死原因。若命令本身需要交互(如
sudo提示输密码、apt-get等待确认),会永久挂起。务必加stdin或用expect处理,或改用幂等模块(如apt); - copy / template 模块:传输大文件时,若目标路径所在文件系统只读、磁盘满、或 SELinux 拒绝写入,会卡在 open/write 系统调用;
- service / systemd 模块:启动服务时若依赖项未就绪(如数据库没起来),systemd 可能默认等待 90 秒才超时,表现为 Ansible 卡住近一分半钟。
快速验证与临时绕过
不重启整个 Playbook,也能快速缩小范围:
- 用 --limit 锁定单台主机测试:
ansible target-host -m ping --limit target-host; - 启用 check mode(干跑):
ansible-playbook site.yml --check,跳过实际执行,只做语法和路径校验; - 对可疑任务加 timeout 参数(支持多数模块):
- name: Run slow script command: /path/to/script.sh timeout: 30。











