
本文介绍如何避免在 Laravel 中对大量数据(如 20 万行)使用 collect()->unique() 导致的严重性能问题,推荐直接通过 SQL 的 DISTINCT 和 COUNT 在数据库层完成去重统计,将执行时间从 15 分钟以上降至毫秒级。
本文介绍如何避免在 laravel 中对大量数据(如 20 万行)使用 `collect()->unique()` 导致的严重性能问题,推荐直接通过 sql 的 `distinct` 和 `count` 在数据库层完成去重统计,将执行时间从 15 分钟以上降至毫秒级。
在 Laravel 应用中,当需要统计某字段(如 mobile)的唯一值数量时,一个常见但高危的误区是:先用 Model::get() 将全部记录加载到内存,再通过集合方法 collect($data)->unique('mobile')->count() 进行去重。这种做法在数据量较小时尚可接受,但面对 20 万条记录时,会引发三重性能瓶颈:
- 内存爆炸:全量查询返回所有字段(即使只用 mobile),极大增加内存占用与网络传输开销;
- PHP 层遍历低效:unique() 内部需逐条比对、哈希存储,时间复杂度接近 O(n),且无法利用数据库索引;
- 无索引优化浪费:即便 mobile 字段已建索引,PHP 层处理完全绕过了数据库的优化能力。
✅ 正确做法是将去重逻辑下推至数据库层,利用 SQL 原生的 DISTINCT 与聚合函数,由数据库引擎高效完成:
protected function getValidLeadCount($schedule_id)
{
return OptoutConnectionLog::where('optout_csv_schedule_id', $schedule_id)
->distinct('mobile')
->count('mobile');
}
该写法生成的 SQL 类似于:
SELECT COUNT(DISTINCT `mobile`) FROM `optout_connection_logs` WHERE `optout_csv_schedule_id` = ?;
✅ 优势说明:
- 索引友好:若 (optout_csv_schedule_id, mobile) 存在联合索引(或 mobile 单列索引),MySQL/PostgreSQL 可直接使用索引完成去重计数,无需全表扫描;
- 零内存压力:仅返回单个整型结果,不加载任何模型实例;
- 毫秒级响应:实测 20 万行数据通常在 50–200ms 内完成,相比原方案提速超 1000 倍。
⚠️ 注意事项:
- distinct('column') 在 Laravel 5.7+ 中支持传入字段名(需确保底层数据库支持,如 MySQL ≥ 5.7、PostgreSQL);
- 若使用 SQLite,需改用 ->selectRaw('COUNT(DISTINCT mobile)')->pluck('expression')->first();
- 确保 mobile 字段允许为 NULL 时行为符合预期(SQL 中 DISTINCT 默认忽略 NULL,若需计入,需额外处理);
- 如后续还需获取去重后的手机号列表(而非仅计数),应使用 ->distinct('mobile')->pluck('mobile'),仍优于 PHP 层去重。
总结:永远优先让数据库做它最擅长的事——过滤、排序与聚合。Laravel 的 Eloquent 是工具,不是替代 SQL 的抽象层;合理使用 distinct()、count()、groupBy() 等链式方法,是保障大数据场景下应用性能的关键实践。











