
本文介绍两种高效解析多段结构化纯文本(如分块的个人信息)为 PHP 关联数组的方法:一种是轻量级的 explode() + trim() 分层解析法,适用于格式规整的数据;另一种是健壮的自定义递归下降解析器,可精准处理字段缺失、空白干扰和结构边界。
本文介绍两种高效解析多段结构化纯文本(如分块的个人信息)为 php 关联数组的方法:一种是轻量级的 `explode()` + `trim()` 分层解析法,适用于格式规整的数据;另一种是健壮的自定义递归下降解析器,可精准处理字段缺失、空白干扰和结构边界。
在实际开发中,我们常需从日志、配置片段或导出的 .txt 文件中提取结构化数据。给定文本按 ---------Section Name--------- 分隔,每段内以 Key: Value 形式组织,且存在重复区块(如多个“Personal info”块)。目标是将其统一转为扁平化、键名标准化的二维数组,例如 'first_name' 替代 'First Name',并支持字段缺失(如末尾区块无 About 字段)。
✅ 推荐方案一:简洁实用型(适用于格式稳定场景)
该方法利用文本天然的双换行 \n\n 作为记录分隔符,再逐行按冒号分割,代码简洁、性能高、易维护:
<?php $input = <<<EOT
---------Personal info ------------
First Name: Fidelis
Last Name: Peter
-----------Account Info ---------
ID: HTY15gd
Username: fidelisepeter
---------More ---------
About: A graphic designer
---------Personal info ------------
First Name: Fidelis
Last Name: Peter
-----------Account Info ---------
ID: HTY15gd
Username: fidelisepeter
---------More ---------
About: A graphic designer
---------Personal info ------------
First Name: Elis
Last Name: Peter
-----------Account Info ---------
ID: HTY15gd
Username: fidenew
EOT;
// 步骤1:按空行分割为独立记录块
$blocks = preg_split('/\n\s*\n/', trim($input), -1, PREG_SPLIT_NO_EMPTY);
$people = [];
foreach ($blocks as $block) {
$person = [];
$lines = explode("\n", $block);
foreach ($lines as $line) {
// 跳过空行、分隔线(含连字符)及无冒号行
if (empty(trim($line)) || preg_match('/^-+/', $line)) {
continue;
}
if (strpos($line, ':') !== false) {
[$key, $value] = array_map('trim', explode(':', $line, 2));
// 标准化键名(小写+下划线)
$normalizedKey = strtolower(str_replace([' ', '.'], '_', $key));
$person[$normalizedKey] = $value;
}
}
$people[] = $person;
}
print_r($people);输出示例(键已标准化):
Array
(
[0] => Array
(
[first_name] => Fidelis
[last_name] => Peter
[id] => HTY15gd
[username] => fidelisepeter
[about] => A graphic designer
)
[1] => Array
(
[first_name] => Fidelis
[last_name] => Peter
[id] => HTY15gd
[username] => fidelisepeter
[about] => A graphic designer
)
[2] => Array
(
[first_name] => Elis
[last_name] => Peter
[id] => HTY15gd
[username] => fidenew
)
)⚠️ 注意事项:
- 使用 preg_split('/\n\s*\n/', ...) 替代简单 explode("\n\n", ...) 可兼容 Windows/Linux 换行及多余空格;
- array_map('trim', ...) 确保键与值首尾无空格;
- 键名标准化(如 First Name → first_name)提升后续代码可读性与一致性;
- 若原始文本来自文件,请用 file_get_contents('data.txt') 替代 $input。
✅ 进阶方案二:高鲁棒性解析器(推荐用于生产环境)
当文本格式存在不确定性(如分隔线长度不一、字段顺序混乱、嵌套层级变化),建议采用状态机式解析器。原答案中的递归下降解析器虽完整,但略显冗长。以下为精简优化版,保留核心逻辑,移除调试代码,增强可读性与容错能力:
<?php function parseTextToPeople(string $input): array {
$people = [];
$blocks = preg_split('/\n\s*\n/', trim($input), -1, PREG_SPLIT_NO_EMPTY);
foreach ($blocks as $block) {
$sections = [];
$currentSection = null;
$lines = explode("\n", $block);
foreach ($lines as $line) {
$trimmed = trim($line);
// 匹配分隔行:以至少3个'-'开头和结尾,中间含文字
if (preg_match('/^[-]{3,}([^-\r\n]+)[-]{3,}$/', $trimmed, $matches)) {
$sectionName = trim($matches[1]);
$currentSection = strtolower(str_replace(' ', '_', $sectionName));
$sections[$currentSection] = [];
continue;
}
// 解析键值对(仅在有当前节时)
if ($currentSection && strpos($trimmed, ':') !== false) {
[$key, $value] = array_map('trim', explode(':', $trimmed, 2));
$normalizedKey = strtolower(str_replace([' ', '.'], '_', $key));
$sections[$currentSection][$normalizedKey] = $value;
}
}
// 合并各节到单个人员数组(扁平化)
$person = [];
foreach ($sections as $section => $fields) {
foreach ($fields as $k => $v) {
$person[$k] = $v; // 直接展平,避免嵌套
}
}
$people[] = $person;
}
return $people;
}
// 使用示例
$people = parseTextToPeople($input);
var_export($people);此版本优势在于:
- 自动识别任意长度的分隔线(---, -------- 均可);
- 按语义节(Personal info, Account Info)分组后再扁平合并,逻辑清晰;
- 完全忽略无关行(如纯分隔符、空行),抗干扰能力强;
- 无正则回溯风险,执行效率高。
✅ 总结
- 优先选用方案一:若数据源格式规范、可控(如自生成文本),它足够简洁、高效、易测试;
- 选用方案二:若需对接第三方不规范文本、或未来可能扩展结构(如新增 Contact Info 节),其模块化设计便于维护;
- 关键实践:始终对输入 trim(),用 preg_split 处理跨平台换行,键名标准化应前置而非后期 str_replace;
- 安全提示:若 $input 来自用户上传,请校验文件大小与内容合法性,避免内存溢出或正则灾难性回溯。
通过以上任一方法,你均可将原始多段文本可靠地转化为结构清晰、易于操作的 PHP 数组,为后续 JSON 输出、数据库写入或模板渲染奠定坚实基础。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











