scikit-learn 不支持协同过滤推荐,因其缺乏专用模型且矩阵分解类不处理稀疏评分数据与隐式反馈;正确做法是用 surprise(api 兼容 sklearn,专为显式评分设计)或 lightfm。

Scikit-learn 本身不提供协同过滤(Collaborative Filtering)的原生实现——它没有 NearestNeighbors 以外的推荐专用模型,比如矩阵分解(SVD、ALS)或隐语义模型。直接用 sklearn 做“协同过滤推荐”会走弯路,甚至得到错误结果。
为什么不能直接用 sklearn.decomposition.NMF 或 TruncatedSVD 做电影推荐?
这些类可以做矩阵分解,但它们默认处理的是稠密特征矩阵,且不支持隐式反馈(如点击、观看时长)或缺失值掩码;电影评分数据天然稀疏,且 NaN 不是 0——把未评分当作 0 分输入,会严重污染分解结果。常见错误现象包括:
- 推荐结果高度偏向热门电影(因大量 0 填充放大了流行度偏差)
-
TruncatedSVD对稀疏矩阵调用.fit()时抛出ValueError: array must not contain infs or NaNs - 用
NMF强行拟合含 0 填充的用户-物品矩阵,导致重建误差大、冷启动用户推荐全失效
正确做法:用 surprise 或 lightfm,而非硬套 sklearn
如果你已习惯 scikit-learn 的 API 风格,surprise 是最平滑的过渡选择——它完全复刻了 sklearn 的 fit()/predict() 范式,专为显式反馈(评分)设计。安装与最小可用示例:
pip install scikit-surprise
关键步骤:
- 用
Surprise.Dataset.load_from_df()加载三元组(user_id, item_id, rating),自动处理稀疏性 - 选择算法如
SVD(不是sklearn.decomposition.TruncatedSVD,而是surprise.prediction_algorithms.matrix_factorization.SVD) -
algo.fit(trainset)后,用algo.predict(uid, iid)获取单个预测分,无需手动重建整个矩阵
注意:surprise.SVD 支持偏置项和正则化,默认即适合评分预测;而 sklearn.TruncatedSVD 只做纯线性分解,无推荐语义。
如果坚持用 sklearn 生态,只能作为辅助工具链一环
例如:用 sklearn.metrics.pairwise.cosine_similarity 计算用户/物品相似度(基于共评数量加权),再做基于邻域的推荐。但必须手动处理稀疏性:
- 原始评分矩阵用
scipy.sparse.csr_matrix存储,不能转成numpy.ndarray - 对每行(用户)计算相似度前,先用
sklearn.preprocessing.StandardScaler(with_mean=False)——with_mean=False是关键,否则稀疏矩阵不支持中心化 - 最近邻搜索必须用
sklearn.neighbors.NearestNeighbors(algorithm='brute', metric='cosine'),且传入csr_matrix,不能用fit(X.toarray())
这种方案性能差、难扩展,仅适合千级用户以下的验证场景。
真正落地时,协同过滤的工程复杂度不在算法调用,而在稀疏数据的表示、负采样策略、线上服务的延迟控制,以及如何把 predict() 结果快速映射到 Top-N 推荐列表——这些 sklearn 都不覆盖。别在包装器上浪费调试时间。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











