复购率需以用户首次购买为基准统计其后续购买,而非简单统计多次下单人数;须用自连接限定时间条件(t2.order_time > t1.first_time),并建立(user_id, order_time)联合索引;mysql 5.7需用变量模拟首单,但存在并发风险。

复购率定义不清会导致GROUP BY结果错乱
复购率不是简单算“买了两次以上的人数占比”,而是要明确:统计窗口内,有多少用户在首次购买后又发生了第二次购买。如果直接对用户ID做GROUP BY再套COUNT(*) > 1,会把同一用户跨月、跨年的多次下单全算进去,结果虚高。必须先锁定“首次购买时间”,再查该用户此后是否还有订单。
自连接必须用时间条件限制,否则笛卡尔积爆炸
典型写法是让订单表orders自连接:左表取每个用户的首单,右表找该用户在首单之后的订单。关键在ON条件里加时间约束,否则会生成大量无效匹配:
SELECT COUNT(DISTINCT t1.user_id) AS first_buyers, COUNT(DISTINCT t2.user_id) AS repeat_buyers FROM ( SELECT user_id, MIN(order_time) AS first_time FROM orders GROUP BY user_id ) t1 LEFT JOIN orders t2 ON t1.user_id = t2.user_id AND t2.order_time > t1.first_time;
-
MIN(order_time)必须出现在子查询中,不能直接在主GROUP BY里用,否则无法关联后续订单 -
t2.order_time > t1.first_time不能写成>=,否则首单自己也会被计入复购 - 如果数据量大,务必给
(user_id, order_time)建联合索引,否则LEFT JOIN会极慢
GROUP BY和COUNT(DISTINCT)嵌套容易漏掉零复购用户
上面的写法能算出分子分母,但如果你要按月份看复购率趋势,直接在外部再套一层GROUP BY DATE_TRUNC('month', t1.first_time)会有问题:某月有首单用户,但没人复购,t2.user_id全为NULL,COUNT(DISTINCT t2.user_id)返回0,这没问题;但若某月根本没首单,整行就消失了——导致月份维度不全。
更稳妥的做法是先生成完整的时间维度表(或用GENERATE_SERIES),再LEFT JOIN进来,而不是依赖原始订单表驱动分组。
MySQL 5.7不支持窗口函数,得用变量模拟首单
如果用的是MySQL 5.7或更老版本,没有ROW_NUMBER(),就不能在子查询里直接取首单。这时得用用户变量“伪排序”:
SELECT user_id, order_time
FROM (
SELECT
user_id,
order_time,
@rn := IF(@prev = user_id, @rn + 1, 1) AS rn,
@prev := user_id
FROM orders
CROSS JOIN (SELECT @rn := 0, @prev := '') AS _
ORDER BY user_id, order_time
) ranked
WHERE rn = 1;
注意这个写法在MySQL 8.0+已被弃用,且在并发查询下变量行为不可靠;生产环境强烈建议升级或改用临时表预计算首单。
复购率计算真正难的不是语法,而是对“首次”和“再次”的业务界定是否统一——比如优惠券核销时间、退款订单是否剔除、跨平台账号合并等,这些逻辑一旦没对齐,SQL写得再漂亮也没用。










