最稳妥方式是取字段第一个字符:mysql用left(name,1),postgresql/sql server用substring(name,1,1),sqlite用substr(name,1,1);需先trim()并过滤null和空字符串,再group by统计,中文首字即姓氏,无需拼音转换。

用 SUBSTRING 或 LEFT 提取姓氏首字母
中文姓名没有空格分隔,不能直接用 SUBSTRING_INDEX 或 split_part;最稳妥的方式是取字段第一个字符。MySQL 用 LEFT(name, 1),PostgreSQL 和 SQL Server 用 SUBSTRING(name, 1, 1),SQLite 同样支持 SUBSTR(name, 1, 1)。注意:如果 name 字段含空格、前导空格或 NULL,得先清理:
- 加
TRIM()防止空格干扰 - 加
WHERE name IS NOT NULL AND TRIM(name) != ''过滤无效值 - 中文环境下,首字就是姓氏(假设数据规范),无需拼音转换逻辑
GROUP BY 首字母后 COUNT 统计
提取后的单字符可直接用于分组。常见写法是把表达式写进 SELECT 和 GROUP BY 两边,避免“Expression not in GROUP BY”错误:
SELECT LEFT(TRIM(name), 1) AS first_char, COUNT(*) AS cnt FROM users WHERE name IS NOT NULL AND TRIM(name) != '' GROUP BY LEFT(TRIM(name), 1) ORDER BY first_char;
PostgreSQL 用户若遇到排序乱序(如「王」「李」排在「A」「B」之后),说明字段是 byte-order 排序而非 Unicode 排序,需显式指定 collation,例如:ORDER BY first_char COLLATE "zh-CN"(取决于数据库支持)。
区分大小写与编码问题导致分组错乱
MySQL 默认不区分大小写(utf8mb4_0900_as_cs 除外),'A' 和 'a' 会被归为同一组;PostgreSQL 默认区分。如果想统一按大写统计,加 UPPER():
-
UPPER(LEFT(TRIM(name), 1))确保英文字母归一化 - 中文字符经
UPPER()不变,无副作用 - 若字段含混合内容(如「Mr. 张三」),正则提取更可靠,但多数数据库原生正则性能差,建议前置清洗
性能敏感时避免函数索引缺失
对 LEFT(name, 1) 做 GROUP BY 无法走普通索引,全表扫描不可避免。如果高频执行该统计,可建函数索引(MySQL 8.0.13+、PostgreSQL 8.4+ 支持):
- MySQL:
CREATE INDEX idx_name_first ON users ((LEFT(TRIM(name), 1))); - PostgreSQL:
CREATE INDEX idx_name_first ON users (UPPER(LEFT(TRIM(name), 1))); - SQLite 不支持函数索引,只能靠覆盖索引 + 应用层缓存
没加索引时,千万级表上首次执行可能秒级延迟,且并发多时易拖慢其他查询。











