
本文介绍如何在 PHP 中使用 preg_match_all() 与 \R 元字符高效提取字符串中所有连续的换行符序列(如 \n、\r\n、\r、\u{2028} 等),并给出正确用法、原理说明及实用注意事项。
本文介绍如何在 php 中使用 `preg_match_all()` 与 `\r` 元字符高效提取字符串中**所有连续的换行符序列**(如 `\n`、`\r\n`、`\r`、`\u{2028}` 等),并给出正确用法、原理说明及实用注意事项。
在处理跨平台文本(如来自 Windows、macOS 或 Unix 的文件)时,换行符格式不统一是常见痛点:\n(LF)、\r\n(CRLF)、\r(CR),甚至 Unicode 行分隔符 \u{2028} 和段落分隔符 \u{2029} 都可能混杂出现。若需精确捕获每一段连续的换行符序列(包括空行产生的多个换行符连用),手动枚举 \r 和 \n 组合极易出错且不可维护。
PHP 的 PCRE 引擎提供了专用元字符 \R,它被设计为通用行结束符匹配器,等价于 (?>\r\n|\n|\r|\x0b|\f|\x85|\u{2028}|\u{2029})(启用 u 修饰符时支持 Unicode)。配合量词 +,\R+ 即可一次性匹配一个或多个连续的、逻辑上构成“换行”的字符序列,完美覆盖题目中要求的场景。
✅ 正确实现如下:
$input = "ABC\nDEF\r\n\rGHI\n\n\r\n";
preg_match_all('/\R+/u', $input, $matches);
print_r($matches[0]);
// 输出:
// Array
// (
// [0] => \n
// [1] => \r\n
// [2] => \r
// [3] => \n
// [4] => \n\r\n
// )
⚠️ 注意:原始问题示例期望结果 ["\n", "\r\n\r", "\n\n\r\n"] 实际隐含对“相邻换行序列是否合并”的理解偏差。严格来说,\r\n\r 并非标准换行序列组合——\r\n 是完整 CRLF,其后单独的 \r 应视为另一个换行符。preg_match_all('/\R+/u') 的行为是贪婪匹配所有连续的 \R 单元,因此 \r\n\r 会被拆分为 \r\n + \r(两个独立匹配),而非合并为一个。若业务逻辑强制要求将 \r 紧跟 \r\n 视为整体(非常规需求),则需自定义模式,但会牺牲可移植性与规范性。
? 关键要点总结:
- 必须使用 u(UTF-8)修饰符,确保 \R 正确识别 Unicode 行分隔符;
- 使用 preg_match_all() 而非 preg_match(),后者仅返回首个匹配;
- \R+ 自动处理重复与混合(如 \n\n、\r\n\r\n、\r\n\r),无需手动构造复杂分支;
- 避免使用 ^、$、[\r\n] 等易受上下文干扰的模式,\R 是语义级抽象,更鲁棒。
此方案简洁、标准、跨平台兼容,是处理换行符提取任务的推荐实践。











