跨平台剧本-视频流水线卡点在于llama 3与文心ai不互通、api分散且缺格式桥接;需强制llama 3按指定json schema输出纯剧本,手动清理非json内容后存为utf-8 scene.json,再通过python循环调用文心一言api逐场景渲染,最后用ffmpeg拼接视频并硬编码whisper+aeneas生成的字幕。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要在Llama 3生成结构化剧本后,自动触发文心AI完成视频渲染,但两个平台不互通、API权限分散、中间缺少格式桥接——这正是跨平台剧本-视频流水线卡点所在。
导出Llama 3剧本为文心AI可识别的JSON Schema
在Ollama或揽睿星舟平台运行Llama 3-8B时,必须强制指定输出结构。直接输入:「请按以下JSON Schema生成1分钟短视频剧本,角色名不超过2人,场景数≤3,每场含【画面描述】【台词】【时长秒数】字段:{"scenes":[{"character":"string","scene_desc":"string","dialogue":"string","duration":0}]}」
模型返回结果若含多余说明文字(如“好的,这是您要的剧本:”),【必须手动删除开头非JSON内容,否则文心AI解析失败】。
复制纯JSON文本,粘贴到本地记事本,另存为utf-8编码的scene.json文件。
文心AI(Windows)基于文心大模型打造,适用于办公写作、内容创作与知识处理场景。最新版新增“全局AI快捷唤起”“本地文件深度解析2.0”“多任务并行Agent协作”以及“AI表格与PPT自动生成能力”,同时优化长文本理解与代码生成能力,让Windows用户可在任意软件中快速调用AI能力,实现更高效的办公与创作体验。
用文心一言API接入scene.json并启动视频渲染
登录百度千帆大模型平台 → 进入「文心一言·图像生成」服务页 → 点击「调用API」→ 在请求体(body)中选择raw → JSON格式 → 将scene.json全文粘入。
关键参数设置: "model": "ernie-vilg-2.0", "prompt": "{{scene_desc}}", "style": "cinematic", "resolution": "1080x1920"
注意:文心AI不接受嵌套数组批量提交,需用Python脚本循环读取scene.json中每个scenes元素,逐条发送请求。单次请求仅处理一个scene_desc字段。
拼接视频帧并合成带字幕的成片
第一步:接收文心AI返回的每张图base64字符串 → 解码保存为001.png、002.png…;
第二步:用ffmpeg按scene.duration字段设定每帧显示时长: ffmpeg -framerate 1/3 -i %03d.png -c:v libx264 -r 30 -pix_fmt yuv420p output.mp4
第三步:用whisper.cpp提取原始台词文本 → 用aeneas对齐时间轴 → 生成.srt字幕文件;
第四步:将字幕硬编码进视频: ffmpeg -i output.mp4 -vf subtitles=subtitle.srt final.mp4










