yii框架需借助smalot/pdfparser等外部库提取pdf文本,再用preg_replace('/[\r\n\t]+/', ' ', $text)等正则去除换行符并清洗空白,注意扫描件需ocr、大文件调内存、编码乱码等问题。

使用 Yii 框架本身并不直接提供 PDF 文本提取功能,它依赖外部库(如 smalot/pdfparser 或 setasign/fpdi + tcpdf)来解析 PDF。要去除提取出的文本中的换行符(包括回车、换行、制表符等),关键在于:先正确提取原始文本,再用 PHP 字符串处理函数清洗。
1. 安装 PDF 解析库(推荐 smalot/pdfparser)
在 Yii2 项目中,通过 Composer 安装轻量且兼容性好的解析器:
composer require smalot/pdfparser
安装后即可在控制器或服务类中使用。
2. 提取文本并去除换行符的核心代码
以下是在 Yii2 控制器中使用的示例(假设 PDF 文件路径已知):
use Smalot\PdfParser\Parser;
public function actionExtractText()
{
$pdfPath = '@app/files/document.pdf'; // 替换为实际路径
$absolutePath = \Yii::getAlias($pdfPath);
if (!file_exists($absolutePath)) {
throw new \Exception('PDF 文件不存在');
}
$parser = new Parser();
$pdf = $parser->parseFile($absolutePath);
$text = $pdf->getText(); // 获取全部文本(含原始换行)
// 去除所有空白符(换行\n、回车\r、制表\t、多余空格),替换为单个空格
$cleanText = preg_replace('/[\r\n\t]+/', ' ', $text);
$cleanText = preg_replace('/\s+/', ' ', $cleanText); // 合并连续空白为一个空格
$cleanText = trim($cleanText);
return $this->asJson(['text' => $cleanText]);
}
3. 注意事项与常见问题
-
PDF 内容是否可选中:若 PDF 是扫描件(图片型),
smalot/pdfparser无法提取文字,需先用 OCR(如 Tesseract)识别,Yii 中需集成thiagoalessio/tesseract_ocr等扩展。 - 中英文混排换行处理:有些 PDF 中文段落会因排版强行换行,清洗时建议保留句号、问号、换行符后的中文字符逻辑,但基础场景用上述正则已足够。
-
内存与大文件:解析超大 PDF 可能触发内存限制,可在 PHP 配置中临时调整:
ini_set('memory_limit', '512M'); -
编码问题:部分 PDF 使用非 UTF-8 编码,
$pdf->getText()默认返回 UTF-8 字符串;若出现乱码,需检查 PDF 内嵌字体和编码声明,一般无需额外转码。
4. 进阶:按页提取并分别清洗
如需保留分页逻辑再清洗每页内容:
$pages = $pdf->getPages();
$cleanPages = [];
foreach ($pages as $page) {
$pageText = $page->getText();
$cleanPage = preg_replace('/[\r\n\t\s]+/', ' ', $pageText);
$cleanPages[] = trim($cleanPage);
}
$fullCleanText = implode(' ', $cleanPages); // 合并为一段











