cof是deepmind为veo 3提出的视觉版思维链,通过逐帧生成画面显化推理过程,如迷宫中红点试探路径而非瞬移;其依赖感知、建模、操控与跨帧推理四层能力,但存在模式复现倾向,在反事实推演等复杂任务中仍受限。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Veo 3 的 CoF(Chain-of-Frames,帧链)不是把视频“一气呵成”生成出来的结果,而是模型在逐帧构建过程中自然显现出的推理节奏——它用画面代替文字,让视觉逻辑可被观察、可被验证。
CoF 是什么:视觉版的“边想边画”
类比语言模型里的思维链(CoT),CoT 是让模型“写出来怎么想的”,比如解数学题时先列公式、再代入、最后算结果;CoF 则是让视频模型“画出来怎么推的”——不直接跳到答案画面,而是一帧一帧演化场景,把推理过程摊开在时间轴上。
例如给指令:“让红点从迷宫起点沿白路走到终点,避开黑墙”。Veo 3 不生成一个红点瞬移过去的视频,而是输出红点试探路径、回退、转向、逐步逼近绿点的8秒过程。这一连串帧本身,就是它的“思考痕迹”。
CoF 背后的能力分层:从看到想,四步递进
CoF 能成立,依赖模型已具备的四项基础能力,它们层层支撑,缺一不可:
Veo 3.1增强了音频生成能力、提示词理解能力和角色一致性控制。支持多参考图生成、场景扩展(Scene Extension)、更长视频制作以及更精准的镜头控制,同时提升了画面真实感和叙事能力。是当前 Google 主推的旗舰视频生成模型。
- 感知能力:准确识别初始图中的结构,比如分辨出迷宫的墙、路、起点与终点位置;
- 建模能力:理解“白线可通行、黑块是障碍”这类空间规则,甚至隐含物理常识(如球会滚落斜坡、液体能填充容器);
- 操控能力:在建模基础上主动改变局部状态,比如让红点移动、旋转、暂停,或临时添加引导箭头;
- 跨帧推理能力:把前几帧的状态作为输入,决定下一帧该呈现什么,形成闭环反馈链条——这才是 CoF 的核心。
CoF 当前的局限:真实推理还是模式复现?
有研究指出,Veo 3 在部分任务中表现出的“推理”,可能只是对训练数据中高频动作序列的模仿。比如走迷宫视频若大量出现在训练集里,模型未必真在规划,而是在调用相似片段拼接。
为检验这一点,港中文等团队构建了 MME-CoF 基准,覆盖空间关系、时间因果、几何变换等12个维度。测试发现:
- 模型在规则明确、模式常见任务中表现稳定(如沿直线移动、镜像翻转);
- 但在需要反事实推演(“如果墙突然消失会怎样?”)或长程依赖(超过5步的条件判断)时,容易断裂或循环;
- 提示稍作扰动(如把“白路”换成“浅灰路径”),输出质量明显下降,说明泛化仍依赖表面线索。
怎么用好 CoF:提示设计是关键入口
CoF 不是自动触发的开关,它高度依赖提示的质量。有效激发帧链推理的提示通常具备以下特征:
- 明确起始帧内容(提供图或详细文字描述);
- 定义动态主体(如“红点”“小车”“水滴”),并赋予其可追踪的视觉标识;
- 强调过程动词而非结果(用“缓慢滑入”“逐级上升”“试探性绕行”,不用“到达”“完成”“生成”);
- 加入约束条件(如“每帧仅移动1像素”“遇到障碍必须停顿2帧”),迫使模型显式建模状态变化。
这些技巧本质上是在给模型铺设一条“推理轨道”,让它更倾向于走 CoF 路径,而不是跳过中间步骤直接渲染终点。










