可灵ai支持文字、图像、视频三类可嵌套组合的输入模态,文字为语义骨架,图像和视频为多模态描述子;需结构化提示词、主次分明图片及合规格式视频。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用可灵AI生成视频,但不确定该从文字、图片还是视频开始输入,担心选错方式导致生成结果偏离预期。
支持的输入模态类型
可灵AI采用多模态视觉语言(MVL)架构,允许你在同一任务中混合使用多种输入形式,而非只能单选一种。
当前支持的输入模态共三类:文字(TXT)、图像(IMG)、视频(VID)。
这三类不是并列选项,而是可嵌套组合的语义单元——文字是语义骨架,图像和视频是嵌入其中的多模态描述子(MMW)。
文字输入:提示词必须结构化
输入长度上限为8000 tokens,系统会自动扩写与润色,但原始提示词仍需具备基本结构。
第一步:明确主体。例如“穿红裙的年轻女性”比“一个女生”更易锁定特征。
第二步:补充动作与环境。例如“在雨中奔跑→溅起水花→背景是霓虹灯牌”,用箭头串联动线,避免堆砌形容词。
第三步:指定镜头与风格。例如“低角度跟拍→电影感胶片色调→21:9超宽画幅”,不写此项时系统默认使用通用运镜逻辑。
【未写明主体或动作节点,模型将按概率采样生成,易出现角色突变或动作断裂】
图片输入:最多10张,需有主次之分
方法一:单图主导法。上传1张高信息密度图(如人物正脸+完整服装+典型姿态),其余9张仅作辅助参考(如局部材质图、光影示意图、风格参考图)。
方法二:分镜锚定法。上传3~5张关键帧草图,按时间顺序命名(frame_01.png、frame_02.png…),系统会据此推演中间帧运动轨迹。
上传图片前请确保分辨率不低于720p,否则细节丢失会导致生成结果模糊或结构异常。
视频输入:最多5段,每段最长10秒
视频片段不用于直接复制动作,而是提取镜头语言、节奏韵律与空间关系。
例如上传一段TikTok舞蹈视频,可灵不会复刻舞步,但会学习其快切节奏、身体重心转移方式与背景虚化逻辑。
若上传的视频含人声对白,系统将同步分析口型-语音匹配特征,用于后续生成中提升口型精度。
注意:视频文件需为MP4或MOV格式,H.264编码,否则上传后无法解析时间轴信息。
多模态组合输入实操路径
① 打开可灵AI创作台 → 点击“新建任务” → 进入多模态输入框。
② 先粘贴结构化提示词(含主体/动作/镜头)→ 再拖入1张主图+2张风格图 → 最后上传1段3秒参考视频(如想模仿某广告的转场节奏)。
③ 点击“生成”前,检查右上角显示的模态组合标签:TXT×1、IMG×3、VID×1 —— 说明全部输入已成功加载。
这一步操作起来很简单,直接把文件拖进去就行。











