git log统计的是提交历史中的增删行数,非当前文件大小或注释空行;需用--numstat配合--pretty=tformat:和awk聚合,否则易因格式错误导致结果为0。

git log 统计代码行数不是看“写了多少”,而是看「提交历史里新增和删减了多少行」——它不反映当前工作区的文件大小,也不统计注释或空行,只统计被 git commit 过的变更。直接用错命令,结果可能全为空或严重失真。
统计单个作者在当前分支的增删行数
这是最常用也最容易出错的场景:漏掉 --pretty=tformat: 会导致 awk 读到提交信息行(含 author、date 等),把非数字当 $1 处理,最终加总为 0。
- 正确写法:
git log --author="zhangsan" --pretty=tformat: --numstat | awk '{ add += $1; subs += $2 } END { printf "added: %s, removed: %s\n", add, subs }' -
--numstat输出三列:新增行数、删除行数、文件路径;只有这两列是纯数字,$1 和 $2 才可靠 - 如果某次提交没改任何代码(比如只改了 commit message),
--numstat不输出该次记录,不会干扰统计 - 不加
--all时,默认只查当前分支,切错分支会漏数据
按时间范围统计所有人贡献并避免空值崩溃
原始脚本里常见问题:某个作者没在这段时间内提交,git log --author=... 返回空,awk 的 END 块里 / 是未定义值,导致输出 added lines: , removed lines: 这种空字段,后续 parse 容易报错。
对比基线与当前 GitHub Actions 运行导出,在 CI 成本和交付周期激增前及时发现工作流或作业运行时性能退化。
- 安全写法:给
awk加默认初值,awk 'BEGIN{add=0;subs=0} {add += $1; subs += $2} END {...}' - 日期格式必须严格为
YYYY-MM-DD,--since="2024-01-01"可以,--since="2024/01/01"会被忽略 - 跨午夜统计(如“今天”)建议用
--since=midnight,比手动算时间更可靠,且自动适配系统时区 - 想排除自动生成文件(如
node_modules、dist),得在管道后加grep -v或用:(exclude)路径限制(Git 2.13+):git log --author=... --numstat -- . ":(exclude)node_modules"
批量统计所有作者并格式化对齐输出
直接用 sort -u 提作者名看似简单,但会丢失提交次数排序,且姓名长度不一导致列错位。更稳的方式是先用 git shortlog -sn 拿带排序的作者列表,再逐个查行数。
- 关键点:
git shortlog -sn输出是「提交数 + 作者名」两列,空格分隔,中间可能有多个空格,while read count author会截断多词姓名(如 “Zhang San” 变成 “Zhang”) - 稳妥拆解方式:
git shortlog -sn | while IFS= read -r line; do set -- $line; count=$1; shift; author="$*"; ... - 用
printf对齐比echo更可控:printf "%-12s %6d %8d %8d\n" "$author" "$count" "$add" "$subs" - 如果项目用了邮箱别名(如提交用
zhang@company.com,但%aN显示 “Zhang San”),--author必须匹配实际提交邮箱,否则查不到 —— 建议先跑git log --pretty='%aE' | sort -u确认真实邮箱
为什么 cloc 和 git_stats 不适合“按人统计”
cloc 统的是当前工作区所有文件的物理行数,跟 git 历史无关;git_stats 生成 HTML 报表依赖 gnuplot,且默认按 commit 时间聚合,不支持按作者过滤或指定时间段。它们适合“项目总规模评估”,但无法回答“张三在 Q1 增加了多少有效逻辑行”这种问题。
-
cloc对git log的替代场景仅限:统计当前 HEAD 下各语言代码量(cloc . --exclude-dir=node_modules) -
git_stats的图表好看,但数据源是git log --numstat的原始输出,自己写脚本解析更灵活、更轻量、更可控 - 真正要复盘个人产出,必须回到
git log --author=... --numstat这条链路,其它工具都是包装层,掩盖了细节偏差
--numstat 输出的每一行都对应一次文件变更,但 Git 不记录“哪几行被删”,只记总数。这意味着你永远算不出某人“实际写了多少新功能”,只能知道他在历史中“累计增删了多少行”。这个数字本身意义有限,关键是怎么用:配合提交频率看节奏,结合文件路径看模块,对照 PR 记录看上下文——脱离背景的行数,只是个整数而已。










