必须人工分段生成视频:先识别场景切换、时间跳转、角色更替、情绪转折四类自然断点,插入【scene_break】标记;再按15秒或30秒分段配置提示词,严格控制时长总和≤180秒;逐段生成后下载原片并规范命名;最后用ffmpeg无损拼接。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要把一段超过3分钟的影视脚本,拆成多个逻辑段落分别生成视频片段,再合成完整成片——文心AI不支持单次输入超长文本直接输出长视频,必须靠人工分段+指令控制+手动拼接来实现。
识别剧本中的自然断点
打开原始剧本,用鼠标逐行阅读,重点标记出“场景切换”“时间跳转”“角色更替”“情绪转折”四类位置。例如“夜→日”“办公室→天台”“争吵后沉默三秒”都是可靠断点;不要在对话中途硬切,否则生成的镜头会丢失语义连贯性。
找到5~8个断点后,在每个断点前插入分隔符【SCENE_BREAK】,保存为新文本文件。这一步漏掉一个关键断点,后续生成的片段就可能无法对齐剪辑点。
配置每段提示词模板
方法一:基础版(适合新手)
在文心AI网页端新建对话,粘贴第一段文本,开头加固定前缀:【请严格按以下要求执行】生成15秒短视频,画面风格统一为4K电影感,镜头语言含中景对话+特写微表情,背景音效仅限环境白噪音,不配旁白,不加字幕,输出格式为MP4,分辨率1080p。
方法二:进阶版(需调用API)
用Python SDK调用ernie-vl-4.5-turbo接口,传入参数:{"prompt": "暴雨夜巷口对峙,穿黑风衣的男人转身,雨滴悬停半空", "duration_sec": 15, "style": "neo-noir", "no_speech": true, "output_format": "mp4"}。
【duration_sec必须是15或30的整数倍,且总和不能超过180】,超出将被强制截断并静音最后3秒。
逐段生成并下载原始素材
第一步:在文心AI官网点击「创作」→「文字生成视频」→ 粘贴第一段带前缀的文本 → 点击生成。
文心AI(Windows)基于文心大模型打造,适用于办公写作、内容创作与知识处理场景。最新版新增“全局AI快捷唤起”“本地文件深度解析2.0”“多任务并行Agent协作”以及“AI表格与PPT自动生成能力”,同时优化长文本理解与代码生成能力,让Windows用户可在任意软件中快速调用AI能力,实现更高效的办公与创作体验。
第二步:等待进度条满格后,立即点击「下载原片」而非「分享链接」——分享链接里的视频会被自动压缩,帧率从30fps降至24fps,导致拼接时出现音画不同步。
第三步:下载完成后,将文件重命名为“scene_01_15s.mp4”,放入本地新建的“raw_clips”文件夹。
第四步:重复①~③操作,处理剩余段落,确保每个文件名含序号与秒数,如scene_02_30s.mp4、scene_03_15s.mp4。
用FFmpeg无损拼接视频
打开终端,进入raw_clips目录,执行:ls *.mp4 | sort -V | awk '{print "file \x27" $0 "\x27"}' > filelist.txt
然后运行:ffmpeg -f concat -safe 0 -i filelist.txt -c copy output_final.mp4










