☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
【人设】上海独居女生|26岁新媒体运营|齐肩棕发+黑框眼镜+白衬衫卷袖,在凌晨1点出租屋厨房煮泡面,灶台有水渍、手机支架歪拍,左手腕戴没撕净的医用胶布;分镜:特写撕调料包(0.8秒)→中景掀盖热气升腾(1.2秒)→主观视角吹面(0.5秒),配asmr式松散吉他bgm;字幕:“这包酸梅粉我囤了37天才敢拆…”(圆体,底部居中,占高12%)。
用可灵ai生成小红书风格短视频,需兼顾平台调性(真实感、生活化、强人设、快节奏)、算法偏好(前3秒抓眼球、字幕突出、bgm情绪匹配)和ai视频模型的实际能力边界(目前不支持复杂运镜或精确口型同步)。
明确人设与场景锚点
第一步:在提示词开头用「【人设】+【身份标签】+【视觉特征】」定调,例如「【人设】上海独居女生|26岁新媒体运营|齐肩棕发+黑框眼镜+白衬衫卷袖」。这能显著提升AI对角色一致性的把控,避免生成中突然换装或变脸。
第二步:绑定具体生活场景,拒绝抽象描述。写「在凌晨1点的出租屋厨房煮泡面,灶台有水渍,手机支架歪着拍」比「温馨居家日常」有效10倍——可灵AI依赖具象空间线索推理镜头逻辑。
第三步:强制加入1个「破格细节」,比如「左手腕戴医用胶布(没撕干净)」「T恤下摆露出一截运动腰带」。这类非完美细节是小红书真实感的核心燃料,AI生成时容易过度精致,必须人工干预。
控制镜头与节奏的实操指令
方法一:用「分镜短句+时长约束」代替模糊要求。
写「特写手撕泡面调料包(0.8秒)→中景掀盖瞬间热气升腾(1.2秒)→主观视角低头吹面(0.5秒)」,比「多个镜头展示煮面过程」准确率高。
方法二:指定BGM类型时关联情绪动词,不写歌名。「用带轻微吉他拨弦的ASMR式BGM,节奏像刚睡醒伸懒腰那样松散」比「配轻松音乐」更能触发可灵对音频纹理的理解。
【关键陷阱】禁用「电影感」「高级感」「大片质感」等空泛词——可灵AI会默认叠加暗角、胶片噪点、慢动作,反而破坏小红书需要的明亮直给画风。
文案与字幕的嵌入技巧
把台词直接写进提示词,并用「字幕:」前缀标注。例如「字幕:这包酸梅粉我囤了37天才敢拆…(字体:小红书默认圆体,位置:底部居中,字号占画面高度12%)」。
口语化断句要模仿真人语流:「不是说…(停顿0.3秒)泡面不能吃(叹气音效)→而是(音调上扬)你得知道怎么救它!」这种结构会让AI优先生成匹配语气停顿的画面节奏。
注意:所有字幕内容必须在提示词里完整写出,可灵AI无法从语音自动提取字幕,且不支持后期添加。











