
本文介绍使用正则表达式从字符串中批量提取位于特定起止标记(如 [TEST])之间的子字符串,并将其安全、准确地存入 PHP 数组的方法。
本文介绍使用正则表达式从字符串中批量提取位于特定起止标记(如 `[test]`)之间的子字符串,并将其安全、准确地存入 php 数组的方法。
在实际开发中,常需从富文本、日志或模板字符串中提取结构化片段——例如从 [TEST]...[TEST] 这类自定义标记包裹的内容中抽取关键词、变量值或动态段落。PHP 提供了强大的 preg_match_all() 函数,配合非贪婪正则匹配,可高效完成此类任务。
核心思路是:使用正则模式 /\[TEST\](.+?)\[TEST\]/,其中:
- \[TEST\] 匹配字面量 [TEST](方括号需反斜杠转义);
- (.+?) 是非贪婪捕获组,匹配任意字符(除换行符外)一次或多次,但尽可能少地匹配,确保正确截取相邻标记间的内容;
- 整个模式全局匹配,preg_match_all() 将所有匹配结果的捕获组(即 $matches[1])自动整理为索引数组。
以下为完整示例代码:
<?php $text = "Lorem ipsum dolor sit amet, [TEST]consetetur[TEST] sadipscing elitr, sed diam nonumy eirmod tempor invidunt ut labore et dolore magna aliquyam erat, sed diam voluptua. At vero eos et accusam et justo duo dolores et ea rebum. Stet clita kasd gubergren, no sea takimata sanctus est Lorem ipsum dolor sit amet. Lorem ipsum dolor sit amet, [TEST]consetetur[TEST] sadipscing elitr, sed diam nonumy eirmod tempor invidunt ut labore et dolore magna aliquyam erat, sed diam voluptua. At vero eos et accusam et [TEST]justo[TEST] duo dolores et ea rebum. Stet clita kasd gubergren, no sea takimata sanctus est Lorem ipsum dolor sit amet.";
// 执行全局非贪婪匹配,捕获所有 [TEST]...[TEST] 中间的内容
preg_match_all('/\[TEST\](.+?)\[TEST\]/', $text, $matches);
// $matches[1] 即为所有提取出的字符串组成的索引数组
$result = $matches[1];
print_r($result);
// 输出:
// Array
// (
// [0] => consetetur
// [1] => consetetur
// [2] => justo
// )
?>
⚠️ 注意事项:
- 若源文本可能含换行符,需添加 s 修饰符(即 '/\[TEST\](.+?)\[TEST\]/s'),使 . 可匹配换行;
- 若标记本身含特殊正则字符(如 *, +, ?, ^ 等),务必全部转义;
- 建议对 $matches[1] 进行空值校验(如 isset($matches[1]) && !empty($matches[1])),避免未匹配时访问非法索引;
- 如需支持嵌套或更复杂语法(如 [TEST level="2"]...[/TEST]),应改用解析器而非正则,避免维护风险。
该方法简洁、高效,适用于大多数标记提取场景,是 PHP 文本处理中的标准实践之一。











