bpftrace是基于ebpf的高级动态追踪工具,支持tracepoint、kprobe等多种探针类型,需注意权限、内核配置、探针可用性及变量作用域;常见问题包括无输出(因权限不足或tracepoint未启用)、时间戳覆盖(需加存在性判断)、键冲突(应使用tid而非pid)、参数布局差异(须查/sys/kernel/debug/tracing/events/等确认)。

直接上手就能用,但不理解 probe 类型和变量作用域,脚本大概率跑不起来或输出为空。
为什么 bpftrace -e 'tracepoint:syscalls:sys_enter_open { printf("hit\n"); }' 没反应?
常见错误是权限不足或内核未启用对应 tracepoint。不是所有系统调用 tracepoint 默认可用,尤其在较老内核(CONFIG_TRACEPOINTS=y 的发行版上。
- 先确认 tracepoint 存在:
ls /sys/kernel/debug/tracing/events/syscalls/sys_enter_open/,不存在就说明内核没编译该点 - 必须用
sudo运行,普通用户无法访问内核 tracing 接口 - 某些发行版(如 RHEL/CentOS 8+)默认禁用 debugfs,需手动挂载:
sudo mount -t debugfs none /sys/kernel/debug - 如果只关心某个进程(比如
curl),加过滤条件更可靠:/comm == "curl"/ { printf("open by %s\n", comm); }
kprobe:vfs_read 和 tracepoint:syscalls:sys_enter_read 有什么区别?
前者是动态插桩,后者是内核预埋的静态点。实际观测中行为差异明显:
Linux系统管理专家,覆盖12大模块:用户权限、SSH、存储、网络、systemd、防火墙、日志监控、备份恢复、TLS证书、Ansible、容器、IaC。提供配置、验证、加固、监控、备份、自动化、故障排查、回滚闭环。关键词:useradd、sudo、sshd_config、chmod、SEL...
-
kprobe:vfs_read能捕获所有内核态 read 调用(包括文件、pipe、socket),但可能被内联优化绕过;tracepoint:syscalls:sys_enter_read只捕获用户态发起的read()系统调用入口,稳定但覆盖范围窄 -
kprobe可用arg0–argN获取寄存器参数,tracepoint必须用args->fd、args->count等结构体字段 - 性能上
tracepoint开销更低,kprobe在高频率函数(如schedule)里容易触发内核采样限流(perf_event_max_sample_rate)
怎么安全地测函数耗时,避免 @start[tid] 键冲突或内存泄漏?
核心是配对清理 + 条件判断。不加 guard 容易因线程复用、异常退出导致 map 键堆积:
- 必须检查
@start[tid]是否已存在,否则重复写入会覆盖时间戳:kprobe:sys_write /!@start[tid]/ { @start[tid] = nsecs; } -
kretprobe阶段要带非空判断:kretprobe:sys_write /@start[tid]/ { @dur = hist((nsecs - @start[tid]) / 1000); delete(@start[tid]); } - 别用
pid当 key——多线程进程里不同线程 tid 不同,但共用一个 pid,会导致统计失真 - 超时兜底:加
interval:s:10 { exit(); }防止脚本卡死
监控内存分配时,kprobe:__kmalloc 为什么输出全是 0?
因为 __kmalloc 参数在不同内核版本位置不同,arg0 在 5.10+ 是 size,但在 4.19 可能是 gfp_flags。硬编码 arg0 极易失效。
- 优先用
tracepoint:kmalloc:kmalloc(如果内核支持),它提供标准化字段:args->bytes_alloc - 若必须用
kprobe,查当前内核符号定义:sudo cat /proc/kallsyms | grep __kmalloc,再结合objdump -t /lib/modules/$(uname -r)/build/vmlinux | grep __kmalloc确认参数布局 - 注意:某些分配路径(如 SLAB 分配器内部)不会经过
__kmalloc,需配合tracepoint:kmalloc:kmalloc_node补全
真正难的不是写一行 bpftrace,而是搞清你看到的每个 arg0、args->xxx、@map 在当前内核版本里到底对应什么内存布局和生命周期。不查 /sys/kernel/debug/tracing/events/ 和 /proc/kallsyms 就开干,等于蒙眼调参。










