“华东%”未查出“华东-上海”是因为字段实际存储的是“上海市”“江苏省”等具体名称,并不含“华东”前缀,like仅匹配开头字符串,无法反向推断地理归属;正确做法是建立区域映射表并join关联。

用 LIKE 匹配模糊区域前缀时,为什么“华东%”没查出“华东-上海”?
因为字段里存的是“上海市”“江苏省”,不是“华东-上海”。LIKE '华东%' 会失败——它只匹配以“华东”开头的字符串,而真实数据根本没含“华东”二字。
真正要做的,是把原始省市名映射到大区。常见错误是试图用 LIKE 反向“猜”归属,这不可靠也不可维护。
- 优先建一张区域映射表:
region_map(area_name, big_region),插入('上海市', '华东')、('江苏省', '华东')等 - 用
JOIN关联销售表,再按big_regionGROUP BY - 如果真要用
LIKE(比如字段含“XX省分公司”),确保统一清洗:先REPLACE(location, '分公司', '')再匹配
MySQL 8.0+ 用 REGEXP 匹配多级区域(如“广东|深圳|东莞”)要注意什么?
REGEXP 看似灵活,但容易因贪婪匹配或大小写栽跟头。比如 city REGEXP '广东|广州' 在“广东省广州市”里会命中两次,但聚合时只算一行——这不是问题;真正问题是 REGEXP '广' 也会意外匹配“广西”。
- 用锚点限定范围:
city REGEXP '^广东$|^广州$|^深圳$',避免子串误中 - MySQL 默认大小写不敏感,但若字段是
utf8mb4_0900_as_cs排序规则,REGEXP就区分大小写,需显式加COLLATE utf8mb4_0900_as_cs或改用REGEXP_LIKE(city, ..., 'i')(8.0.22+) - 性能差:没有索引支持,全表扫描。万级以上数据量,必须先走映射表或生成物化列
PostgreSQL 中用 SIMILAR TO 或正则做区域归类,比 MySQL 更稳吗?
不更稳,只是语法和默认行为不同。SIMILAR TO 实际是 SQL 标准里的一个“半正则”语法,功能比 ~(PostgreSQL 原生正则)弱,且不支持分组捕获,不适合动态提取区域名。
- 直接用
~:例如province ~ '^(广东|广西|海南)$',注意括号必须转义为\(才能字面匹配,否则是分组 - 用
CASE WHEN+ 多个~判断,比单条长正则更易读、易调优 - PostgreSQL 支持函数索引,可对
(CASE WHEN province ~ '广东' THEN '华南' END)建索引,加速聚合
当区域字段是 JSON(如 {"province": "广东", "city": "深圳"})时,怎么安全提取并汇总?
别用 LIKE 或正则去解析 JSON 字符串——格式稍变就崩。各数据库都有原生 JSON 提取函数,必须用它们。
- MySQL:
JSON_UNQUOTE(JSON_EXTRACT(data, '$.province')),配合IN或映射表使用 - PostgreSQL:
(data->>'province'),返回 text,可直接JOIN region_map - SQLite(3.38+):
json_extract(data, '$.province'),注意它返回带引号字符串,需TRIM(..., '"') - 绝对不要写
data LIKE '%"province":"广东"%'——字段值换行、空格、转义都会让它失效
CASE WHEN 也比后期调试一堆正则边界条件省时间。










