sql能做线性回归,本质是直接计算最小二乘法公式;主流数据库可通过sum/count手算斜率与截距,oracle和postgresql还内置regr_slope(y,x)、regr_intercept(y,x)等函数,语义清晰且自动处理null。

SQL 能做线性回归,但不是靠“训练模型”,而是靠直接计算最小二乘法公式——只要数据库支持 SUM、COUNT 和基本算术,就能手算斜率和截距;部分数据库(如 Oracle、PostgreSQL)还内置了专用聚合函数,更稳更快。
用标准 SQL 手算 slope 和 intercept
核心是把最小二乘公式拆成可聚合的中间量:样本数 n、SUM(x)、SUM(y)、SUM(x*x)、SUM(x*y)。所有主流 SQL 引擎(MySQL 8.0+、PostgreSQL、SQL Server、SQLite 3.35+)都支持。
- 必须确保
x列不全相同,否则分母为 0,会报division by zero错误 -
SUM(x * y)在某些旧版 MySQL 中需写成SUM(x * y)(不能用+或空格替代*) - 如果数据含
NULL,SUM和COUNT(*)行为不一致:COUNT(*)计所有行,COUNT(x)才忽略NULL;推荐统一用COUNT(x)避免样本数错估
WITH stats AS (
SELECT COUNT(x) AS n,
SUM(x) AS sum_x,
SUM(y) AS sum_y,
SUM(x * x) AS sum_xx,
SUM(x * y) AS sum_xy
FROM data_table
WHERE x IS NOT NULL AND y IS NOT NULL
)
SELECT
(n * sum_xy - sum_x * sum_y) / (n * sum_xx - sum_x * sum_x) AS slope,
(sum_y - slope * sum_x) / n AS intercept
FROM stats;
Oracle / PostgreSQL 内置函数更省事
Oracle 和较新版本的 PostgreSQL(12+)直接提供 REGR_SLOPE、REGR_INTERCEPT、REGR_R2 等函数,语义清晰、自动跳过 NULL、且数值稳定性更好。
- 参数顺序是
REGR_SLOPE(y, x),注意不是(x, y)—— 这是高频翻车点 -
REGR_COUNT(y, x)返回有效配对数,比COUNT(*)更准 - 若只传一列(如
REGR_SLOPE(y, 1)),会被当作常数拟合,结果恒为 0,别误用
SELECT REGR_SLOPE(y, x) AS slope, REGR_INTERCEPT(y, x) AS intercept, REGR_R2(y, x) AS r_squared FROM data_table;
MySQL 和 SQL Server 没有原生回归函数怎么办
MySQL 直到 8.4 仍无 REGR_* 函数;SQL Server 2022 引入了 PERCENTILE_CONT 等,但依然没加回归聚合。这时必须手写公式,且要注意浮点精度陷阱。
- MySQL 默认除法返回整数(如
5/2 = 2),务必显式转成浮点:CAST(... AS DECIMAL(12,6))或乘1.0 - SQL Server 的
/运算符也受操作数类型影响,INT / INT → INT,建议全部字段先CONVERT(FLOAT, x) - 避免在子查询里重复计算
SUM(x)多次——CTE 或内联视图一次性算完更安全
为什么结果和 Excel 不一样
常见偏差来源不是公式错,而是数据预处理不一致:
- Excel 的“趋势线”默认剔除图表中被手动隐藏或筛选掉的行,而 SQL 统计的是物理存储的全部行
- Excel 对
NULL或空单元格的处理逻辑和 SQL 不同;导出数据时可能把空字符串当0导入,实际应为NULL - 某些 BI 工具(如 Tableau)在连接 SQL 数据库时会自动启用“聚合下推”,但可能绕过你写的 CTE,导致中间统计量被重算
最保险的做法:先用 SELECT COUNT(*), COUNT(x), COUNT(y) FROM data_table 确认有效样本数,再和 Excel 里“已选数据点数量”对齐——差一个数,结果就偏了。











