可灵ai于2025年12月推出kling o1与kling video 2.6,前者是统一多模态视频创作引擎,支持文本/图像/视频/主体参考联合输入;后者实现音画同出,生成含语音、音效、环境声的10秒内视频,共同推动ai从单帧生成迈向全流程创作辅助。

2025年12月,可灵AI在短时间内连续公开两个重要更新:Kling O1与Kling VIDEO 2.6。前者定位为统一多模态视频模型,强调把文本、图像、视频和主体参考纳入同一个创作引擎;后者则主打“音画同出”,让用户可以一次生成包含画面、语音、音效和环境声的视频内容。这两项更新共同指向一个趋势:AI视频工具正在从“生成一段画面”转向“协助完成完整创作流程”。
Kling O1的意义在于统一输入和统一任务。官方公告将其描述为可整合参考生成、文生视频、首尾帧、视频补绘、视频转化、风格化、视频延展等能力的创作引擎。对创作者而言,这意味着不必在多个模型和工具之间频繁切换,也可以通过自然语言、图片、视频片段和主体素材共同表达创意。比如广告团队可以上传产品图、人物图和背景图,再描述镜头动作和视觉风格,让模型生成产品展示片段;影视团队则可用角色和道具参考维持连续镜头中的视觉一致性。
Kling VIDEO 2.6则解决了AI视频创作中的另一个痛点:声音。此前许多AI视频生成工具输出的是静音视频,创作者还需要在剪辑软件中补充旁白、对白、音效和环境声。快手公告显示,2.6支持文本到音画视频、图片到音画视频,可生成自然语音、动作音效和环境氛围,并支持中英文语音和最长10秒的视频内容。这对社交媒体短片、电商产品介绍、品牌广告和剧情小片都有实际帮助,尤其适合快速验证创意是否在视听层面成立。
这两项能力也改变了内容团队的分工方式。过去,一个短片草案可能需要脚本、分镜、视觉参考、配音、音效和剪辑多个环节配合;现在,团队可以先用O1建立一致性素材和镜头方向,再用2.6验证音画关系,最后进入人工剪辑、调色、混音和合规审查。AI不一定直接生成最终片,但可以显著加快从创意到样片的速度。
需要注意的是,O1与2.6并不是没有限制。O1的多模态编辑对输入素材质量、提示词结构和参考关系非常敏感;2.6虽然能生成声音,但商业广告中的配音质感、语气控制、品牌规范和音频版权仍需复核。随着VIDEO 3.0上线,O1和2.6的部分能力已经被进一步整合和升级。对于新项目,建议以3.0作为主评估对象,同时保留O1和2.6作为特定场景下的工作流选择。











