6月5日,在2026 ai产业应用大会上,腾讯云音视频正式推出ai原生音视频能力底座——wand。基于逾20年的深厚技术积淀,腾讯云音视频此次从底层模型架构、核心媒体能力到接入范式完成全栈重构,音视频ai能力以agent-native方式全面开放,标志着其战略重心由单一媒体处理能力输出,跃升为面向ai原生应用与智能体(agent)的全栈式媒体基础设施。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WAND采用三层架构设计:模型引擎层、能力层与场景方案层。其中,模型引擎层集成六大自研媒体专用大模型——涵盖编解码、画质增强、内容擦除、多模态生成、语义理解及音频处理,精准填补通用生成式大模型在专业音视频生产链路中的能力空白。能力层则对60余项音视频AI能力进行体系化重构,按“生成—理解—处理—编码”四大维度归类,并通过标准化API、预置Agent工作流(Agentic Workflow)以及可复用Skills组件三种方式开放调用,真正实现Agent驱动的端到端自动执行,全程无需人工干预或工具切换。

WAND能力架构图
腾讯云通用文字识别(高精度版)技能包。用户发送/粘贴图片、提供图片URL或要求识别图片文字时自动调用。支持中文、英文、中英混合、数字及特殊符号的检测与识别,返回文字框位置与内容。适用于文字较多、版式复杂、准召率要求高的场景。
在实际落地场景中,WAND展现出卓越的业务适配性与运行效率。例如,在电商领域,其生成模型支持按商品类目动态匹配差异化处理策略,显著降低任务失败率,同时提升生成图像的可用性与合规性;在短剧与漫剧创作中,WAND打通剧本生成、角色形象一致性维护、分镜渲染等关键环节,构建全自动生产流水线,使整体创作效率提升达90%,目前已覆盖国内超80%的头部漫剧平台;其AI画质增强与无痕内容擦除技术更双双斩获NAB Show 2026年度产品奖。
针对赛事直播这类高并发、超低延时的核心场景,WAND依托自研模型协同调度机制,将目标识别、画面生成、实时合成与高效编码深度耦合为闭环自动化流程,在保障极致体验前提下,相较传统方案节省码率超50%,已成功支撑全球数千场顶级体育赛事直播。
作为连续11年稳居中国及海外音视频云服务市场份额首位的领军者,腾讯云音视频正通过WAND加速音视频能力向“Agent可调度、可编排、可生产”的工业级工具演进,全面夯实AI Agent时代视听内容创新的技术基座。










