
本文介绍如何在 $ o(n) $(实正交群)上实现真正均匀的随机采样,指出常见 svd 方法的偏差问题,并给出基于 haar 测度的正确实现方案,同时说明距离约束采样的理论限制与可行替代策略。
本文介绍如何在 $ o(n) $(实正交群)上实现真正均匀的随机采样,指出常见 svd 方法的偏差问题,并给出基于 haar 测度的正确实现方案,同时说明距离约束采样的理论限制与可行替代策略。
在数值计算、随机矩阵理论、压缩感知及降维建模中,常需从所有 $ n \times n $ 实正交矩阵构成的群 $ O(n) = { Q \in \mathbb{R}^{n\times n} : Q^\top Q = In } $ 中均匀采样——即服从其唯一双不变概率测度:Haar 测度。然而,直接对高斯随机矩阵做 SVD 分解(如 `u, , _ = np.linalg.svd(np.random.randn(n,n))`)虽能生成正交矩阵,却并不服从 Haar 测度,尤其在维度升高时表现出显著偏差:如题中所示,随着 $ n $ 增大,采样矩阵与单位阵 $ I_n $ 的 Frobenius 余弦相似度(即 $ \langle Q, I_n \rangle_F / |Q|_F |I_n|_F = \operatorname{tr}(Q)/n $)范围急剧收缩,趋近于零,意味着极端结构(如接近 $ I_n $ 或 $ -I_n $)几乎无法被采样到。这源于 SVD 方法隐含地偏好“条件数适中”的矩阵,而 Haar 测度要求所有正交方向完全等权。
✅ 正确方法:使用 Haar 测度采样
SciPy 自 1.6.0 版起已内置严格遵循 Haar 测度的采样器:scipy.stats.ortho_group。其底层实现基于经典的 Mezzadri 算法(也称 Householder QR 方法),核心思想是:
- 逐列构造正交基:从标准基开始,对每一列施加随机 Householder 反射;
- 每次反射的角度参数从恰当的 Beta 分布中采样,确保最终分布关于群运算左/右不变;
- 时间复杂度为 $ O(n^3) $,与 SVD 相当,但统计性质严格最优。
from scipy.stats import ortho_group
import numpy as np
def random_orthonormal_matrix_haar(n):
"""返回服从 O(n) 上 Haar 测度的 n×n 随机正交矩阵"""
return ortho_group.rvs(dim=n)
# 验证:检查与 I_n 的迹(即 Frobenius 内积)分布
n = 16
samples = np.array([np.trace(random_orthonormal_matrix_haar(n)) for _ in range(10000)])
print(f"Trace mean: {samples.mean():.4f} (theoretical: 0)")
print(f"Trace std: {samples.std():.4f} (theoretical: sqrt(n) ≈ {np.sqrt(n):.2f})")
运行结果将显示迹(trace)均值稳定在 0(理论期望),标准差接近 $ \sqrt{n} $,且极值分布随 $ n $ 增长缓慢扩展——这正是 Haar 测度的特征:$ \operatorname{tr}(Q) $ 在 $ O(n) $ 上渐近服从 $ \mathcal{N}(0, 1) $(对大 $ n $),而非坍缩至零。
⚠️ 关于“固定距离采样”的说明
问题中进一步询问:“能否直接生成与单位阵距离恰好为 $ d $ 的正交矩阵?”——此处需明确距离定义与可行性边界:
- 若采用 Frobenius 距离 $ d_F(Q, I) = |Q - I|_F = \sqrt{2n - 2\operatorname{tr}(Q)} $,则 $ \operatorname{tr}(Q) \in [-n, n] $,故 $ d_F \in [0, 2\sqrt{n}] $。给定 $ d $,等价于约束 $ \operatorname{tr}(Q) = n - d^2/2 $。
- 然而,Haar 测度下 $ \operatorname{tr}(Q) $ 是连续随机变量,单点概率为零;因此精确固定距离的采样无意义。
- 更实用的是条件采样:例如,在 $ { Q \in O(n) : |\operatorname{tr}(Q) - t|
替代方案是利用正交矩阵的谱分解:任意 $ Q \in O(n) $ 可写为 $ Q = V \Lambda V^\top $,其中 $ V \sim \text{Haar} $,$ \Lambda = \operatorname{diag}(e^{i\theta_1},\dots,e^{i\theta_n}) $(实正交情形下,特征值为 $ \pm 1 $ 或共轭复对)。若限定 $ Q $ 为特殊正交($ \det Q = 1 $),则可显式控制旋转角分布。但此类构造通常牺牲采样效率,且难以保证全局均匀性。
✅ 总结与建议
- 避免 SVD 方法:它不满足 Haar 不变性,高维下严重偏离均匀性;
- 首选 scipy.stats.ortho_group:开箱即用、数学严谨、性能可靠;
- 距离约束需谨慎:优先考虑区间条件(如 $ d_F \in [d-\delta, d+\delta] $)而非精确值,并评估接受率;
- 扩展场景:对复酉矩阵 $ U(n) $,使用 scipy.stats.unitary_group;对子空间(Stiefel 流形 $ V_{k,n} $),可用 scipy.stats.ortho_group.rvs(dim=n)[:,:k] 截取前 $ k $ 列(仍保持 Haar 性质)。
均匀采样正交矩阵不是工程技巧,而是测度论与群表示论的交汇点。选择正确的工具,方能在高维统计推断、随机算法分析与机器学习基础研究中获得可复现、可验证的结论。











