
本文详解如何使用 PHP 批量读取指定目录下的所有 .txt 文件,将每文件首行作为标题、其余内容作为正文,并按 ID, titulo, contenido 三列格式写入 CSV 文件,同时规避变量未初始化、内容累积污染等常见错误。
本文详解如何使用 php 批量读取指定目录下的所有 `.txt` 文件,将每文件首行作为标题、其余内容作为正文,并按 `id, titulo, contenido` 三列格式写入 csv 文件,同时规避变量未初始化、内容累积污染等常见错误。
在处理大量文本文件并导出为结构化数据时,一个典型需求是:每个 .txt 文件对应 CSV 中的一行,其中第一行为标题(titulo),剩余部分为正文(contenido),并自动分配唯一递增 ID(ID)。原始代码存在两个关键问题:一是未初始化 $contenido 变量导致 .= 运算符引发“undefined variable”警告并意外继承上一轮残留内容;二是逐行拼接逻辑冗余且易出错。
以下是优化后的完整解决方案,具备健壮性、可读性与生产可用性:
<?php // 1. 获取所有 .txt 文件路径(支持中文路径需确保文件系统编码一致)
$files = glob("archivos/*.txt");
if (!$files) {
die("⚠️ 未找到任何 .txt 文件,请检查 'archivos/' 目录是否存在且有读取权限。\n");
}
// 2. 初始化 CSV 数据数组,首行为表头
$datosparacsv = [
["ID", "titulo", "contenido"]
];
$id = 0;
// 3. 遍历每个文件,安全提取标题与内容
foreach ($files as $file) {
// 使用 file() 一次性读取全部行(保留换行符,自动处理 CRLF/LF)
$lines = file($file, FILE_IGNORE_NEW_LINES | FILE_SKIP_EMPTY_LINES);
if (empty($lines)) {
error_log("⚠️ 跳过空文件: {$file}");
continue;
}
// 提取首行作为标题,并清理首尾空白(含不可见 Unicode 空格)
$titulo = trim($lines[0], " \t\n\r\0\x0B\xC2\xA0");
// 剩余行合并为内容(保持原始换行与缩进)
$contenido = implode("\n", array_slice($lines, 1));
// 写入当前记录:ID 自增、标题、内容(注意:$id++ 在赋值后立即递增)
$datosparacsv[] = [$id++, $titulo, $contenido];
}
// 4. 写入 CSV 文件(自动处理引号、逗号、换行等特殊字符)
$csvFile = fopen('entradas.csv', 'w');
if (!$csvFile) {
die("❌ 无法创建 CSV 文件 'entradas.csv',请检查写入权限。\n");
}
foreach ($datosparacsv as $row) {
// fputcsv 自动转义双引号、包裹含逗号/换行的字段,无需手动设置分隔符或包围符(默认即 , 和 ")
if (fputcsv($csvFile, $row) === false) {
error_log("❌ CSV 写入失败,行数据:" . json_encode($row));
}
}
fclose($csvFile);
echo "✅ 成功生成 entradas.csv,共处理 " . count($files) . " 个文件。\n";
?>
关键改进说明:
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- ✅ 变量安全初始化:彻底移除未定义的
$contenido .= ...,改用array_slice()+implode()明确截取并拼接内容,杜绝跨文件数据污染; - ✅ 健壮的文件处理:添加
FILE_IGNORE_NEW_LINES | FILE_SKIP_EMPTY_LINES标志,避免空行干扰;增加空文件跳过与错误日志; - ✅ CSV 标准兼容:依赖
fputcsv()原生能力处理特殊字符(如内容含换行、逗号、双引号),无需手动转义或配置分隔符; - ✅ 清晰的 ID 逻辑:使用
$id++在[]中直接递增,语义明确,避免索引错位; - ✅ 生产级防护:检查
glob()结果、fopen()返回值,并提供友好错误提示。
示例输出(entradas.csv):
ID,titulo,contenido 0,"Titulo 1","texto 1" 1,"Titulo 2","texto 2 texto3 texto4"
? 注意事项:若 TXT 文件含 UTF-8 BOM 或非 UTF-8 编码(如 GBK),需先用
mb_convert_encoding()转换;Windows 环境下建议在fopen()后添加stream_filter_append($csvFile, 'convert.iconv.UTF-8/UTF-8');确保 CSV 编码统一。最终 CSV 可直接被 Excel、Google Sheets 或数据库工具正确识别。










