需将超3分钟影视脚本拆为5~8段生成视频再拼接:先标场景切换等断点并插入【scene_break】;再按15/30秒分段,配统一风格提示词;逐段生成下载命名规范mp4;最后用ffmpeg无损拼接成片。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要把一段超过3分钟的影视脚本,拆成多个逻辑段落分别生成视频片段,再合成完整成片——文心AI不支持单次输入超长文本直接输出长视频,必须靠人工分段+指令控制+手动拼接来实现。
第一步:识别剧本中的自然断点
打开原始剧本,用鼠标逐行阅读,重点标记出“场景切换”“时间跳转”“角色更替”“情绪转折”四类位置。例如“夜→日”“办公室→天台”“争吵后沉默三秒”都是可靠断点;不要在对话中途硬切,否则生成的镜头会丢失语义连贯性。
找到5~8个断点后,在每个断点前插入分隔符【SCENE_BREAK】,保存为新文本文件。这一步漏掉一个关键断点,后续生成的片段就可能无法对齐剪辑点。
第二步:为每段配置独立提示词模板
方法一:基础版(适合新手)
在文心AI网页端新建对话,粘贴第一段文本,开头加固定前缀:【请严格按以下要求执行】生成15秒短视频,画面风格统一为4K电影感,镜头语言含中景对话+特写微表情,背景音效仅限环境白噪音,不配旁白,不加字幕,输出格式为MP4,分辨率1080p。
文心AI(Windows)基于文心大模型打造,适用于办公写作、内容创作与知识处理场景。最新版新增“全局AI快捷唤起”“本地文件深度解析2.0”“多任务并行Agent协作”以及“AI表格与PPT自动生成能力”,同时优化长文本理解与代码生成能力,让Windows用户可在任意软件中快速调用AI能力,实现更高效的办公与创作体验。
方法二:进阶版(需调用API)
用Python SDK调用ernie-vl-4.5-turbo接口,传入参数:{"prompt": "暴雨夜巷口对峙,穿黑风衣的男人转身,雨滴悬停半空", "duration_sec": 15, "style": "neo-noir", "no_speech": true, "output_format": "mp4"}。注意【duration_sec必须是15或30的整数倍,且总和不能超过180】,超出将被强制截断并静音最后3秒。
第三步:逐段生成并下载原始素材
① 在文心AI官网点击「创作」→「文字生成视频」→ 粘贴第一段带前缀的文本 → 点击生成。
② 等待进度条满格后,立即点击「下载原片」而非「分享链接」——分享链接里的视频会被自动压缩,帧率从30fps降至24fps,导致拼接时出现音画不同步。
③ 下载完成后,将文件重命名为“scene_01_15s.mp4”,放入本地新建的“raw_clips”文件夹。
④ 重复①~③操作,处理剩余段落,确保每个文件名含序号与秒数,如scene_02_30s.mp4、scene_03_15s.mp4。
第四步:用FFmpeg无损拼接视频
打开终端,进入raw_clips目录,执行:ls *.mp4 | sort -V | awk '{print "file \x27" $0 "\x27"}' > list.txt && ffmpeg -f concat -safe 0 -i list.txt -c copy final_long.mp4
这条命令会按文件名自然排序(scene_01→scene_02→scene_03)拼接,-c copy参数确保不重新编码,避免画质损失和音频漂移。
如果某段生成失败导致黑屏,删掉对应scene_xxx.mp4后再运行一次命令——FFmpeg不会报错,但会跳过损坏文件继续拼接。










