如何提高Python中协同过滤的计算效率_使用SVD矩阵分解技术

千辰吖_3684

千辰吖_3684

2026-05-12

886人浏览

原创

当用户/物品数超10⁴时,直接两两算cosine/pearson相似度时间复杂度o(n²×m)、内存爆炸(如5万×5万矩阵需~10gb),且无法跳过稀疏数据中90%+的零值;truncatedsvd通过将稀疏user_item_matrix投影到低维潜在空间(如k=50)压缩维度、保留共现结构,显著降耗。

如何提高python中协同过滤的计算效率_使用svd矩阵分解技术

为什么直接算用户/物品相似度会变慢

当用户数或物品数超过 10⁴ 级别,用 cosine_similarity 或 pearsonr 两两计算相似度,时间复杂度是 O(N²×M),内存占用会爆炸式增长。比如 5 万用户 × 5 万用户 的相似度矩阵,即使用 float32 也需近 10 GB 内存,且 NumPy 全量计算时无法跳过零值——而真实协同过滤数据中,90%+ 的 user_item_matrix 元素是 0。

用 TruncatedSVD 替代原始相似度计算

不硬算相似度,而是把稀疏的 user_item_matrix 投影到低维潜在空间(比如 k=50),再在该空间里做向量运算。这既压缩维度,又天然保留共现结构:

  • TruncatedSVD 是 sklearn 中唯一支持 scipy.sparse 输入的 SVD 实现,必须用它,不能用 np.linalg.svd
  • 输入矩阵必须先转成 scipy.sparse.csr_matrix,否则 fit() 会静默转稠密,OOM 风险极高
  • k 值不是越大越好:k > 100 后收益递减,反而放大噪声;推荐从 k=20 开始试,配合验证集 RMSE 调优
  • 不要对原始评分做中心化(即不用减去用户均值):SVD 本身不具备平移不变性,中心化会破坏稀疏性且无必要
from sklearn.decomposition import TruncatedSVD
from scipy.sparse import csr_matrix
<h1>假设 ratings_df 是 pandas DataFrame,含用户-物品评分</h1><p>sparse_mat = csr_matrix(ratings_df.values)
svd = TruncatedSVD(n_components=50, random_state=42)
user_embeddings = svd.fit_transform(sparse_mat)  # shape: (n_users, 50)</p><h1>后续相似度可直接用 user_embeddings 算余弦:cosine_similarity(user_embeddings)</h1>

ItemCF 场景下用 SVD 的关键变形

ItemCF 本质是算物品相似度,但直接对物品维度(列)做 SVD 效果差——因为物品数常远大于用户数,且单物品被评次数少,向量太稀疏。正确做法是:

Li Python Sec Check
Li Python Sec Check

Python 安全规范检查工具:基于 CloudBase 规范、腾讯安全指南,LLM 智能分析(默认禁用,优先本地执行)

下载
  • 对 user_item_matrix.T(即物品 × 用户矩阵)做 SVD,得到 item_embeddings
  • 或更稳妥:先用 TruncatedSVD 对原始 user_item_matrix 得到 user_embeddings,再用 svd.components_ 作为 item_embeddings(这是 SVD 的对偶性质)
  • 避免用 NearestNeighbors 暴力搜最近邻:改用 sklearn.metrics.pairwise.cosine_similarity(item_embeddings, dense_output=False),返回 sparse 矩阵,只存 top-K 相似项

训练后部署时的内存与延迟陷阱

SVD 模型本身轻量,但线上推理容易踩两个坑:

  • 每次请求都重新 fit_transform:错!fit() 只在离线训练时跑一次,线上只需 transform() 新用户行为向量(需先映射到原矩阵列空间)
  • 缓存整个 user_embeddings 矩阵:如果用户量达百万级,float32 × 百万 × 50 ≈ 200 MB,可接受;但若存全量 cosine_similarity 矩阵(百万 × 百万),绝对不可行
  • 增量更新难:SVD 不支持真正的 online update。实际中,建议每 6–12 小时全量重训一次,比拼实时性不如拼特征新鲜度(例如加权最近 30 天行为)

真正卡性能的往往不是 SVD 本身,而是稀疏矩阵构造和 embedding 查表逻辑。务必用 csr_matrix.indptr 和 .indices 手动索引,别用布尔掩码或 df.loc。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4164

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24057

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2947

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2967

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1143

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2303

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程