德塔文热度数据通过爬取全网公开文本,经nlp筛洗后按讨论度、搜索热度、媒体曝光率、口碑倾向四大维度加权计算。原始数据限用户主动发布且播出后72小时内内容,排除营销号搬运与无效感叹,抖音ocr低于85%的字幕不计入。

你想知道德塔文数据到底怎么算出来的,不是看它榜单上那个数字就完事——得弄清背后抓的是什么、怎么加权、哪些平台算进去了、哪些词被当有效信号。
德塔文热度数据的原始来源
德塔文不接入任何平台后台播放数据,也不统计会员数或点击量。它只做一件事:全网爬取公开可访问的文本内容,包括微博正文、评论、热搜话题页、豆瓣短评、知乎问答、小红书笔记、B站弹幕和视频标题/简介、抖音文案、今日头条文章标题与正文段落、百度贴吧帖子及回帖。
所有数据必须满足两个硬性条件:【必须是用户主动发布的文字内容】,且【发布时间在剧集播出或官宣后72小时内】——过期未发酵的旧帖不计入当日景气值。
比如《水龙吟》开播当天,一条带#水龙吟#话题的微博正文写“唐俪辞出场三秒我截图十次”,这条会被计入;但同一天某营销号发的“今日影视资讯汇总”里顺带提了一句“古装新剧《水龙吟》上线”,没带角色名、没情绪倾向、没互动意图,这条直接过滤掉。
自然语言处理的关键筛洗步骤
第一步:识别有效观剧行为表述。系统会排除纯资讯转发、剧照搬运、无意义感叹(如“啊啊啊啊”)、仅含剧名无实质内容的跟风打卡帖。
第二步:绑定角色与讨论强度。当文本中同时出现剧名+角色名(如“水龙吟 唐俪辞”),且含有评价性词汇(“疯批”“美强惨”“演技封神”),才触发角色贡献度计分;若只提剧名不提人,只算入总讨论度,不拆解到角色维度。
第三步:去重与权重校准。同一用户24小时内对同一剧集发布5条相似内容,只计1条有效;媒体账号(认证蓝V)单条内容权重=普通用户10条,但需满足原创率>70%(系统比对历史发文模板库)。
注意:抖音字幕OCR识别准确率低于85%的视频,其文本不参与建模——这意味着大量口播类短视频即使有热度,也不会进入德塔文原始语料池。
四大核心维度的数据构成方式
方法一:全网讨论度 = 有效文本量 × 情绪强度系数(正向/负向/中性分别赋值1.2 / 0.8 / 0.3) × 平台传播广度系数(微博1.0,豆瓣0.9,B站0.85,小红书0.8,抖音0.7)
方法二:搜索热度 ≠ 百度指数。德塔文自建搜索行为模拟器,每天凌晨3点模拟10万真实IP在百度、微信搜一搜、B站搜索框输入“水龙吟 播放”“唐俪辞 结局”等组合词,记录前三位结果页点击率与停留时长,反推搜索意愿强度。
方法三:媒体曝光率 = 有效新闻稿数量 × 媒体等级系数(央媒1.5,省级卫视官网1.2,垂直影视媒体1.0,自媒体0.6) × 是否含独家采访片段(+0.3)
方法四:口碑倾向 = 正向评价占比 − 负向评价占比,但仅统计含具体论据的文本(如“打戏节奏好”算有效,“好看”不算),且剔除带明显营销话术模板的批量产出内容(系统已标记超2.3万个高频营销短语库)。
待播剧景气指数的特殊计算逻辑
第一步:锁定官宣节点。以官微/官博首条含剧名+主演+定档日期的博文发布时间为T₀,此后7天内所有相关文本计入“预热期数据池”。
第二步:剥离演员个人热度干扰。系统自动过滤掉演员过往作品关键词(如搜“穆祉丞”时排除“星落凝成糖”“九霄寒夜暖”等旧剧名),只保留与待播剧强绑定的新造词(如“烽影燃梅香 梅久”“枭起青壤 宋冉”)。
第三步:识别真实期待信号。出现“蹲”“求速播”“已充优酷年费”等明确消费意图表述,权重翻倍;而“听说要播”“好像挺火”类模糊表达,权重降为0.4。
这一步最容易出错:如果剧方在官宣前3天集中释放主演路透图,但图中未打剧名水印,系统无法关联到待播剧ID,这部分声量不会计入景气值——【没有明确剧名锚点的内容,一律不认】。











