java中用正则捕获组提取子串需先pattern.compile()编译,再matcher.find()匹配后调group(n)获取括号内容:group(0)为全匹配,group(1)起对应左到右编号的捕获组;命名组用(?...)和group("name")访问。

Java 中用正则表达式捕获组提取子串,核心是 Pattern 编译正则、Matcher 执行匹配,再通过 group(int) 获取括号内的捕获内容。
定义带括号的正则,明确你要抓什么
捕获组就是用圆括号 () 包裹的子表达式。每个括号从左到右编号,group(0) 是整个匹配结果,group(1) 是第一个括号,group(2) 是第二个,依此类推。
例如,想从 "订单号: ORD-2024-7891,金额: ¥129.50" 中分别提取订单号和金额:
"订单号:\s*(\w+-\d{4}-\d+),金额:\s*¥(\d+\.\d{2})"
这里两个括号就是两个捕获组:第一个抓订单号格式,第二个抓带两位小数的金额。
用 Pattern 和 Matcher 执行匹配并取值
不能直接用 String.replaceAll() 或 split() 获取捕获组——它们不暴露分组信息。必须走标准流程:
- 调用
Pattern.compile(正则)得到 Pattern 对象 - 用
pattern.matcher(文本)创建 Matcher - 调用
matcher.find()(找第一个匹配)或matcher.matches()(全串匹配) - 匹配成功后,用
matcher.group(1)、matcher.group(2)等获取对应捕获内容
示例代码片段:
String text = "订单号: ORD-2024-7891,金额: ¥129.50";
Pattern p = Pattern.compile("订单号:\s*(\w+-\d{4}-\d+),金额:\s*¥(\d+\.\d{2})");
Matcher m = p.matcher(text);
if (m.find()) {
String orderNo = m.group(1); // "ORD-2024-7891"
String amount = m.group(2); // "129.50"
}
注意非捕获组和命名捕获组(Java 7+)
如果只是分组但不需要提取内容,用 (?:...) 避免占用 group 编号,提升可读性和性能。比如:"(?:https?://)?(\w+\.\w+)" 中的协议部分不捕获,域名才是重点。
Java 7 起支持命名捕获组,写法是 (?<name>...)</name>,之后可用 m.group("name") 取值,比记数字更安全:
Pattern p = Pattern.compile("时间:(?<hour>\d{2}):(?<minute>\d{2})");
Matcher m = p.matcher("时间:14:35");
if (m.find()) {
String h = m.group("hour"); // "14"
String mnt = m.group("minute"); // "35"
}</minute></hour>
常见坑与建议
- 没调
find()或matches()就直接调group()→ 抛IllegalStateException - group 编号越界(比如只有 2 个括号却调
group(3))→ 抛IndexOutOfBoundsException - 某组可能没匹配到(比如可选内容),用
m.group(2)前先用m.start(2) != -1判断是否匹配成功 - 正则中含中文、空格、标点时,注意转义或使用
\s、\p{P}等 Unicode 类更稳妥
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南











