正则分支逻辑用|实现“或”关系,从左到右尝试匹配,成功即返回;需括号限定作用域,长模式宜前置;支持嵌套修饰符和命名组以区分匹配来源。

正则中的分支逻辑,核心就是用 |(竖线)实现“或”关系,让一个表达式能匹配多种互斥的模式。它不是条件判断,而是并列尝试——引擎从左到右依次试,一旦某一分支匹配成功,就返回结果(默认不回溯尝试其他分支,除非前面失败)。
基础写法:用 | 连接多个字面模式
最直接的方式是把几个完整子模式用 | 连接,例如:
-
r"cat|dog|bird"可匹配字符串中任意一个单词; -
r"\d{3}-\d{2}-\d{4}|\d{9}"可匹配社保号格式(如123-45-6789)或纯9位数字; - 注意优先级:
r"ab|cd"是“ab”或“cd”,不是“a”后接“b|c”再接“d”。如需限定作用范围,必须加括号。
分组与分支结合:控制匹配边界和捕获
单独用 | 容易因边界不清导致意外匹配。加入括号可明确作用域,并支持分组捕获:
-
r"(fast|slow) car"匹配“fast car”或“slow car”,括号确保 | 只在“fast”和“slow”之间生效; -
r"(\w+) (?:is|was) (\w+)"中(?:...)是非捕获组,避免多余分组干扰,只提取主语和表语; - 若分支长度差异大,建议把长模式放前面(如
r"javascript|java"),否则“java”可能提前截断匹配,漏掉更长的“javascript”。
嵌套分支与模式修饰符配合
分支内部可嵌套修饰符,实现局部行为定制:
-
r"(?i)http|https"整体不区分大小写,等价于r"(?i)https?"; -
r"(?i)the (?-i)cat"表示“the”不区分大小写,“cat”严格小写; -
r"(?s)start.*?end"让.能跨行匹配,适合多行文本中定位起止标记。
获取全部匹配而非首个
re.search() 默认只返回第一个成功分支的结果;要拿到所有可能匹配项,用:
-
re.findall(r"pattern1|pattern2|pattern3", text)—— 返回所有匹配到的字符串列表; - 若需区分来自哪个分支,可为每个分支加命名组:
r"(?P<url>https?://\S+)|(?P<email>\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b)"</email></url>,再遍历re.finditer()检查.lastgroup; - 注意:命名组不能重复,且
findall()对含多组的模式会返回元组,需结构化处理。











