b站弹幕数据需先通过bv号调用视频api获取cid,再请求https://comment.bilibili.com/{cid}.xml;xml为gb2312编码须指定encoding='gbk',弹幕内容在标签体中用elem.text提取,并用html.unescape()解码html实体。

弹幕数据从哪来:B站XML接口的实际调用方式
B站弹幕不是直接存数据库里给你查的,而是按视频cid从https://comment.bilibili.com/{cid}.xml返回标准XML。这个cid必须从视频API里取,不能靠URL猜——比如https://www.bilibili.com/video/BV1xx411c7mu里的BV号得先用https://api.bilibili.com/x/web-interface/view?bvid={bvid}请求,再从返回JSON的data.cid字段里提取。
常见错误是跳过这步直接拼XML地址,结果404或返回空XML。注意:一个视频可能有多个cid(如多P视频),需确认目标分P的cid;另外部分新番或版权内容会关闭弹幕,接口返回<error>no permission</error>,这时强行解析会报错。
解析XML弹幕时绕开编码和标签陷阱
B站弹幕XML是GB2312编码但不声明,Python默认用UTF-8读会报UnicodeDecodeError。必须显式指定encoding='gbk'(Python 3.10+兼容GB2312)。
弹幕文本藏在<d p="...">xxx</d>的标签体里,不是属性值。用xml.etree.ElementTree时别写成elem.get('p')去取内容——那是时间戳和位置参数。正确做法是elem.text。
- 遇到
<d p="123.45,1,25,16777215,1735689012,0,0,0">哈哈哈</d>,elem.text才是“哈哈哈” - 弹幕含HTML实体如
❤(❤),要用html.unescape()解码,否则词云里显示乱码 - 过滤掉纯数字、单字、URL(正则
r'https?://\S+')、以及长度
生成词云前必须做的三件事:分词、停用、字体
wordcloud本身不支持中文分词,直接喂进去就是逐字切——“数据分析”变成“数”“据”“分”“析”四个无意义单字。必须先用jieba.lcut()切词,再用collections.Counter统计频次。
停用词不能只删“的”“了”,B站弹幕高频无意义词得单独加:比如“awsl”“破防”“绷不住了”“下次一定”——这些词出现上万次但没分析价值。建议维护一个stopwords.txt文件,每行一个词,用set(line.strip() for line in open(...))加载。
字体路径必须显式指定font_path参数,否则中文全显示方块。Mac用/System/Library/Fonts/PingFang.ttc,Windows用C:/Windows/Fonts/msyh.ttc,Linux用/usr/share/fonts/truetype/wqy/wqy-microhei.ttc。别信文档里“自动检测”的说法。
词云图模糊/文字重叠/颜色单调?检查这几个参数
默认WordCloud()生成的图常糊成一片,核心是三个参数没调:
-
width和height至少设到1920,否则缩放后边缘锯齿 -
max_words默认200,热门视频弹幕几万条,得设成500或1000才看得清长尾词 -
collocations=False必须加,否则“芜湖”“起飞”这种固定搭配会被合并计数,失真 - 配色别用默认
colormap='viridis',中文词云推荐colormap='Set2'或自定义color_func函数,按词长或频次动态变色
最后导出用to_file('danmaku.png'),别用plt.show()——它会压缩画布导致文字糊。如果要加背景图,mask参数只接受灰度NumPy数组,不是PNG路径。
真正麻烦的从来不是代码几行,而是每次B站改接口返回结构、XML加新字段、或者突然对爬虫IP限速——留个time.sleep(1)比啥都管用。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











