awk是shell中处理结构化文本的高效工具,核心逻辑为“按行读入、按字段拆解、条件驱动动作”;需用-f指定分隔符,支持多分隔符及列级正则/数值条件筛选。

awk 是 Shell 脚本中处理结构化文本最实用的工具之一,它不依赖外部程序、语法简洁、一次命令就能完成过滤、提取、计算、格式化整套操作。关键在于理解“按行读入、按字段拆解、条件驱动动作”这个核心逻辑。
字段提取与分隔符控制
默认以空格或制表符切分字段,但真实数据往往用冒号、逗号、斜杠等分隔。必须用 -F 显式指定,否则会错位。
-
/etc/passwd 按冒号取用户名和 shell:
awk -F: '{print $1, $7}' /etc/passwd - CSV 文件含逗号和空格混合分隔:
awk -F'[[:space:],]+' '{print $2, $4}' data.csv - 同时支持多个分隔符(如日志中既有空格又有方括号):
awk -F'[][]|[[:space:]]+' '{print $5, $6}' access.log
行筛选与条件匹配
模式部分决定哪一行参与后续动作,支持正则、数值比较、逻辑组合,比 grep 更精准——能限定在某列里匹配。
PyCharm 2026.2.0.1 Linux版提供 JetBrains 官方 2026.2.0.1 版本安装包,适合需要指定 PyCharm 版本进行 Python 项目开发、运行和调试的用户。
- 只处理第 3 列大于 100 的行:
awk '$3 > 100 {print $0}' sales.txt - 第一列含 “error” 且第 4 列时间在 09:00–17:00 之间:
awk '$1 ~ /error/ && $4 >= "09:00" && $4 - 匹配以 root 开头、且第七列不是 /sbin/nologin 的用户:
awk -F: '$1 == "root" && $7 !~ /nologin$/ {print $1, $3, $7}' /etc/passwd
统计汇总与简单计算
awk 内置变量 NR(总行数)、NF(当前行列数)、END 块,让计数、求和、平均值变得极简。
- 统计文件总行数:
awk 'END {print NR}' file.txt - 计算第二列数值总和:
awk '{sum += $2} END {print sum}' data.txt - 算平均分(假设每行是姓名+三科成绩):
awk '{avg = ($2 + $3 + $4) / 3; print $1, sprintf("%.1f", avg)}' scores.txt - 统计某字段出现次数(如统计 access.log 中各 IP 请求量):
awk '{count[$1]++} END {for (ip in count) print ip, count[ip]}' access.log
格式化输出与 BEGIN/END 预处理
用 BEGIN 设置初始状态(如分隔符、标题),END 收尾汇总;printf 控制对齐与精度,比 print 更可控。
- 加表头并右对齐 UID:
awk -F: 'BEGIN {printf "%-15s %s\n", "User", "UID"} {printf "%-15s %s\n", $1, $3}' /etc/passwd - 把内存使用百分比转为整数并标注:
free | awk 'NR==2 {printf "Used: %d%%\n", int($3/$2*100)}' - 初始化变量再累加(避免未定义警告):
awk 'BEGIN {total=0} {total += $NF} END {print total}' numbers.txt
不复杂但容易忽略——真正用好 awk,不在记多少参数,而在养成“先想字段、再定条件、最后选动作”的习惯。日常运维、日志分析、报表生成,一条命令顶一个小型脚本。










