re.sub 的 callback 参数接收一个 re.match 对象并返回字符串;必须传函数名(不加括号),签名应为 def func(match: re.match) -> str,返回 none 则替换为空字符串。

re.sub 的 callback 参数到底传什么?
re.sub 的第三个参数可以是字符串,也可以是函数。当传入函数时,这个函数会在每次匹配成功后被调用,接收一个 re.Match 对象作为唯一参数,返回值将作为本次替换的内容。
常见错误是传入带括号的函数调用,比如 re.sub(pattern, my_func(), string) —— 这会让函数立刻执行,返回值(通常是 None)被当作替换字符串,导致报错或静默失败。
正确写法是只传函数名(不加括号):re.sub(pattern, my_func, string)。
函数签名必须严格为:
def my_func(match: re.Match) -> str:返回值必须是字符串;返回
None 会导致该次匹配被替换成空字符串,不是报错,但容易误判。
回调函数里怎么安全提取和处理捕获组?
match.group() 返回整个匹配内容,match.group(1)、match.group('name') 分别按序号或命名组取值。但直接访问可能抛出 IndexError 或 KeyError,尤其当某组未参与匹配(比如分支中未命中)时。
使用场景:正则含可选分组(如 (\d+)?)或交替(如 (foo)|(bar)),某些分支下部分组为 None。
安全做法:
- 用
match.group(1) or ''替代裸调用 - 用
match.group('num') if match.group('num') else '0' - 更稳妥:先检查
match.lastindex(最大非空序号组)或match.lastgroup(最后匹配的命名组)
注意:即使正则写了命名组,如果该组没匹配上,match.group('name') 就是 None,不是空字符串。
为什么回调里修改全局状态会出问题?
很多人想在回调里累积计数、拼接列表、或更新外部字典,例如:
counter = 0
def inc_and_replace(m):
global counter
counter += 1
return f"[{counter}] {m.group()}"
这在单线程下看似可行,但一旦正则匹配跨多行、或后续用到 re.subn、或在多线程环境(如 Web 请求中复用编译后的 pattern),counter 就会错乱。
更隐蔽的问题:Python 的 re 模块不保证回调调用顺序是否严格按文本位置从前到后(实际是,但不应依赖)。若逻辑依赖“第 N 次匹配”,应改用 re.finditer + 手动拼接,而非靠全局变量计数。
推荐替代方案:
- 把状态封装进闭包:
def make_counter_replacer():<br> count = 0<br> def replacer(m):<br> nonlocal count<br> count += 1<br> return f"[{count}] {m.group()}"<br> return replacer<br>re.sub(pattern, make_counter_replacer(), text) - 或用类实例维护状态,更清晰可控。
性能瓶颈常出在回调函数体内部
re.sub 本身很快,但回调函数若做重操作(如打开文件、发起 HTTP 请求、反复 re.search),整体性能会断崖式下降,且难以调试。
典型低效模式:
- 在回调里对
m.group()再做一次正则解析(本可用更宽泛 pattern 一次性捕获) - 调用
json.loads解析嵌套 JSON 字符串,而原始文本中 JSON 格式并不总合法,引发异常中断整个替换 - 循环拼接长字符串(如
result += …),应改用''.join(list)预收集
另外注意:Python 正则引擎默认不缓存编译结果。如果回调内反复调用 re.compile,务必提前编译并复用对象,否则每次调用都重新编译,开销极大。
最易被忽略的一点:回调函数返回的字符串,会被原样插入结果,不会再次经过正则引擎处理 —— 所以别指望它能“递归替换”。需要多轮替换,得自己控制循环,或改用 re.findall + re.sub 组合。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











