cloudflare 于 10 月 9 日正式对外宣布,推出全新开源权重决策模型 clef-omni。该模型在继承原有文本与图像处理能力的同时,首次原生支持音频及端到端视频格式解析,可通过一次 api 调用完成跨模态内容的联合推理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

多模态能力跃迁与技术架构解读
在多模态能力演进上,初代 Clef 模型主要聚焦于文本、静态图像,以及基于固定时间采样的视频帧序列。而 Clef-omni 实现了对 wav、mp3、mp4 和 webm 等主流音视频格式的直接接入,无需开发者再额外集成语音识别(ASR)、音视频解封装或关键帧提取等预处理模块,显著简化了多模态应用的工程链路。
据官方披露的技术文档显示,Clef-omni 底层基于 Qwen3-Omni-30B-A3B-Instruct 进行深度适配与优化,完整保留其多模态语义理解能力。该模型专为结构化判断类任务设计,不面向通用文本生成场景。实测数据显示:纯文本输入的中位响应延迟约 130 毫秒,图像输入约为 150 毫秒;一段含语音的 21 秒 MP4 视频,端到端评分耗时仅约 1.5 秒。
定价策略调整与全系模型定位对比
随着 Clef-omni 的上线,Cloudflare 同步优化了 Clef-flash 的资费结构——每百万输入 Token 的单价由 0.09 美元下调至 0.038 美元,降幅达 57.8%;其托管版本的上下文长度也从 64k 缩减为 24k。当前 Clef 系列已形成覆盖轻量推理、高吞吐决策与全模态分析的差异化产品矩阵,兼顾性能表现与成本效率。











