零基础在pixtv做出首条ai短片需五步:一建768p/60秒画布并锁参数;二用含动作、对象、反馈的句子生成镜头骨架;三建档角色(四视图)与场景(结构/色调/道具);四逐镜用minimax h3生成并校验一致性;五在画布内配语音、微调时长、加淡入淡出完成粗剪。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

零基础想在PixTV上做出第一条能发出去的AI短片,不是先点“生成视频”,而是从画布空白处开始——把文字、角色、镜头、声音全部塞进同一个项目里,让所有素材天然对得上号,避免后期疯狂修脸、调色、对口型。
第一步:新建无限画布并锁定核心参数
打开 PixTV官网 → 点击「New Canvas」→ 选择「Short Film」模板(不是「Image Only」或「Video Only」)。
进入画布后,立刻在右上角「Project Settings」中设置三项不可逆参数:【时长上限设为60秒】、【默认视频分辨率选768P】、语言选中文。这三步跳过会导致后续所有镜头无法统一节奏,且768P是MiniMax H3最稳定、单价最低($0.014/秒)的输出规格。
别碰「Auto-Adjust Aspect Ratio」开关——它会偷偷把你的竖屏镜头拉成横屏,改完要重做全部分镜。
第二步:用一句话定死故事骨架
在画布顶部中央的「Script」文本框里,直接输入一句能拍出来的冲突句,例如:“她撕掉辞职信,手机弹出老板发来的升职通知”。
这句话必须满足三个硬条件:含1个动作(撕)、1个视觉对象(辞职信)、1个即时反馈(弹窗通知)。AI不认“犹豫”“后悔”“突然想起”,只认手指、纸张、屏幕亮光这些可截图的瞬间。
输完后点击「Convert to Shots」,系统自动生成4–6个初始镜头节点,每个节点自动带时间戳和占位图——这是你整部短片的脊椎,后面所有操作都挂在这串节点上。
第三步:批量建档角色与场景(不是单张图乱生)
方法一:角色建档(必做)
点击左侧「Characters」→ 「+ New Character」→ 填写:姓名、年龄、发型(例:“齐肩黑发,左耳戴银环”)、常穿服装(例:“米白针织衫+深灰阔腿裤”)、标志性动作(例:“说话时习惯用食指轻点太阳穴”)。填完点「Generate Reference Pack」,系统自动用GPT Image 2.5生成正面/侧面/半身/微笑四张标准图。这四张图将作为后续所有镜头的脸部锚点,跳过此步,第3镜和第7镜人物会像换了个人。
方法二:场景建档(推荐)
点击「Scenes」→ 「+ New Scene」→ 描述空间结构(例:“开放式办公区,靠窗有绿植,桌面有MacBook和咖啡杯”)、主色调(例:“浅木纹+灰白墙+暖光”)、关键道具(必须写具体型号或颜色,如“黑色MagSafe充电器”)。生成后选中这张图,拖到对应镜头节点上,该镜头所有视频将强制继承此环境光和构图逻辑。
注意:不要在「Images」标签页单独生图再上传——那样生成的图不会绑定到角色/场景库,后续视频模型根本找不到参考依据。
第四步:按镜头节点逐个生成视频(不批量、不跳步)
回到画布中央的时间线,点击第一个镜头节点 → 在右侧「Video Generation」面板中:选择模型为「MiniMax H3 768P」→ 提示词栏自动填充角色+场景+动作描述(如“年轻女性站在办公桌前,右手捏着撕开的A4纸,纸屑飘落,窗外天光微亮”)→ 点击「Generate」。
生成完成后,立即播放预览:检查三点——脸是否和参考图一致、手部动作是否自然、背景物品是否和场景建档图匹配。任何一项不符,立刻点「Regenerate with Same Seed」重试,最多两次;第三次还不对,返回第三步检查角色描述是否漏了“左耳银环”这类细节。
第二个镜头开始,重复同样流程,但提示词中需加入镜头逻辑衔接词,例如第二镜写:“她低头看手机,屏幕特写显示‘升职通知’弹窗,手指悬停在‘接受’按钮上方”。这样两镜之间才有因果关系,剪辑时不用加转场也能顺。
第五步:在画布内直接配声与粗剪
所有镜头视频生成完毕后,点击画布底部「Audio」标签 → 点「Add Voiceover」→ 输入台词(如“我……不走了”),选择「MiniMax Speech 3.0」模型 → 生成语音轨。
语音生成后,自动吸附到最近镜头节点下方。拖动语音轨两端,裁掉多余气口;若某句台词比画面长,选中该镜头视频→点击「Extend Duration」→ 选择「Loop Motion」,让角色微表情循环,不露破绽。
最后点击顶部「Timeline View」→ 将所有镜头节点按顺序拖入时间线区域→ 检查相邻镜头间是否有0.3秒以上的黑场或跳帧 → 有则选中前一镜末尾→点「Fade Out」,后一镜开头→点「Fade In」,两处均设为0.2秒。导出前不执行此步,成片会卡顿。











