如何用Python构建一个基于协同过滤的电影推荐系统?

酷瑶小哥_4950

酷瑶小哥_4950

2026-09-08

344人浏览

原创

协同过滤在电影推荐中的关键是处理稀疏矩阵、冷启动和相似度中心化;scikit-surprise封装了带行中心化的余弦/皮尔逊相似度,user_based=true更适配movielens-100k,knnwithmeans比knnbasic的rmse低0.03~0.05,新用户需混合genre加权向量而非纯热门推荐。

如何用python构建一个基于协同过滤的电影推荐系统?

协同过滤在电影推荐里不是“能不能做”,而是“怎么避免推荐出用户早看腻的类型”——关键不在算法本身,而在于稀疏评分矩阵怎么处理、冷启动怎么绕开、以及相似度计算时要不要对用户评分做中心化。

scikit-surprise 快速跑通基于用户的协同过滤

别从零实现 pearson_similaritycosine_similarityscikit-surprise 封装了带中心化的余弦和皮尔逊相似度,且自动处理缺失值填充逻辑。它默认对用户评分做行中心化(减去该用户平均分),这对消除用户打分习惯差异很关键——比如有人习惯打 4~5 分,另一人只打 2~3 分。

实操建议:

  • SVD 类比 KNNBasic 更快,但解释性弱;若需可解释推荐理由(如“因为和你相似的用户也喜欢这部电影”),选 KNNBasicKNNWithMeans
  • KNNWithMeansKNNBasic 多一步用户均值中心化,实际在 MovieLens-100K 上 RMSE 通常低 0.03~0.05
  • 必须调用 trainset.build_testset() 再传给 test(),不能直接用原始 DataFrame —— 否则会报 ValueError: test set contains unknown users/items

稀疏矩阵下 user_based=True 还是 user_based=False

MovieLens 数据中用户数(~943)远小于电影数(~1682),所以设 user_based=True(基于用户协同)更稳。一旦设成 False(基于物品协同),相似度矩阵维度变成 1682×1682,内存占用翻倍,且新电影加入时要全量重算物品相似度。

但注意:如果后续要支持“看了 A 电影的人还看了 B”,就得切到 item_based,这时必须预存 trainset.ir(item ratings dict)来加速邻居查找。

python-docx
python-docx

python-docx Skill功能概述python-docx Skill是一项面向实际任务的技能,主要用于本Skill提供使用python-docx生成专业Word文档的标准方法和最佳实践;生成安全服务方案文档;核心要点生成技术架构设计文档;生成任何需要专业排版的Word文档;核心库 : python-docx;使用与执行辅助库 : docx.shared , docx.enum , docx.oxml.ns;标准代码模板;1. 文档初始化;2. 字体设置(必须!它将相关步骤、工具调用和结果整理方式集

下载

常见错误现象:

  • user_based=False 后训练极慢,CPU 占用高但进度条不动 → 检查是否漏了 sim_options={'user_based': False}
  • 预测时 algo.predict(uid, iid) 返回 Rating 对象,其 est 字段才是预测分,不是直接返回数值

如何绕过新用户冷启动问题?

协同过滤天生不处理新用户。硬加一个“默认推荐 Top-N 热门电影”只是兜底,真正可用的做法是混合一层基于内容的信号:提取电影的 genre 向量(one-hot),用用户已评电影的 genre 加权平均,生成初始偏好向量,再拿这个向量去近邻电影池里找相似项。

性能影响:

  • 纯协同过滤模型加载后预测单个 (user, item) 耗时约 0.8~1.2ms;加 genre 加权后升至 3~5ms,但能覆盖 60%+ 的新用户首推场景
  • 不要在预测时实时算 genre 向量 —— 提前用 pandas.get_dummies() 算好并存为 np.ndarray,用 np.dot() 查找最匹配电影
  • 避免用 TfidfVectorizer 处理 genre 字符串:genre 是离散标签,不是文本,Tfidf 会引入无意义的权重偏差

协同过滤真正的难点不在公式,而在数据落地时的边界:用户没评过任何电影怎么办、某部电影只有 2 个评分要不要进相似度计算、时间戳字段要不要参与划分训练/测试集。这些细节不写进代码注释,模型上线后就会在凌晨三点触发告警。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1551

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3604

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1549

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

20577

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2547

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2607

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1063

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2023

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程