嵌套分组的捕获编号按左括号出现顺序线性分配,不分层级:(a(b(c)))中group(1)、group(2)、group(3)依次对应外层、中间、内层括号;命名分组与非捕获组均遵循此规则,反向引用和替换只依赖数字编号。

嵌套分组的捕获逻辑核心就一条:**所有左括号按出现顺序编号,不分内外层级**。外层括号先出现就是 group(1),内层括号后出现就是 group(2)、group(3),以此类推。
编号只看左括号位置,不看嵌套深度
比如正则 (A(B(C))) 看似三层嵌套,但编号完全由“(”从左到右的顺序决定:
-
(A(B(C)))→ group(1),最外层括号 -
(B(C))→ group(2),第二个左括号 -
(C)→ group(3),第三个左括号
不存在“group(1.1)”或“第二层 group(1)”这种说法——编号是线性的、全局的,不是树状的。
命名分组也遵循相同编号规则
即使用了命名语法,编号依然存在。例如 (?P<outer>A(?P<inner>B(C)))</inner></outer>:
- 整个
(?P<outer>...)</outer>是 group(1),同时名为outer - 内部
(?P<inner>B(C))</inner>是 group(2),同时名为inner - 最内层
(C)是 group(3),无名
你可以用 match.group(2) 或 match.group('inner') 获取相同内容,二者指向同一个捕获结果。
非捕获组不参与编号,也不影响后续编号
像 (?:A(B)(C)) 这种写法中:
-
(?:...)不占编号,不算 group -
(B)是第一个实际捕获组 → group(1) -
(C)是第二个 → group(2)
也就是说,非捕获组只是“透明括号”,它让表达式更清晰、提升性能,但不会打乱编号序列。
替换和反向引用依赖编号而非结构
在替换字符串或正则内部反向引用时,只认数字编号:
-
re.sub(r'(\w+):(\d+)', r'ID:\2, NAME:\1', 'user:1001')→ID:1001, NAME:user -
r'(["\']).*\1'中的\1指第一个捕获的引号字符,不管它是否嵌套在其他括号里
哪怕嵌套再深,只要它是第 n 个左括号,反向引用就用 \n,替换就用 $n 或 \n。











