cloudflare 近日正式推出全新开源权重决策模型 clef-omni。该模型在前代 clef 系列基础上完成关键性跃迁,不仅原生兼容文本与图像输入,更首次实现对音频及端到端视频内容的直接解析能力。目前,其全部模型权重已在 hugging face 平台完整开放。
在技术架构与功能设计层面,Clef-omni 重构了传统多模态处理范式。旧版 Clef 在处理视频时,通常需依赖预处理流程——将视频按帧序列切分为大量静态图像后再逐帧分析;而 Clef-omni 则原生支持 wav、mp3、mp4 和 webm 等主流音视频格式,无需额外语音转录或帧提取模块。开发者仅需一次 API 请求,即可无缝整合文本、图像、音频与视频四类模态的联合推理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

就性能与基准测试结果而言,该模型基于 Qwen3-Omni-30B-A3B-Instruct 架构深度优化,全面继承其底层语义理解与跨模态对齐能力。作为面向结构化决策任务的专业模型,它不生成泛化的长文本回复。据官方实测数据显示:纯文本请求的中位响应延迟约为130毫秒,图像输入约为150毫秒;一段含语音、时长21秒的视频输入,亦可在约1.5秒内完成高质量评分输出。
随着 Clef-omni 的发布,Cloudflare 同步更新了相关产品定价策略。其中,Clef-flash 的输入费用下调幅度达约58%,由原先每百万输入 Token 0.09美元降至0.038美元;托管版本的上下文窗口容量也由64k调整为24k。总体来看,Clef-omni 的开源落地与多模态能力全覆盖,正为全球开发者打造高复杂度智能工作流与自动化决策系统提供更强劲、更经济的底层模型支撑。











