Ai Video Pipeline

Polar Sponsor
爱发电 赞助
.NET 9.0

对话式AI短视频创作工具:用户提出想法,Agent生成脚本,人工确认后自动生成MP4。触发条件:①制作视频/短视频;②AI旁白视频;③认知自述/播客风格视频;④文稿转视频。仅出现“视频”“TTS”“语音”等模糊词时不激活(可能是其他需求)。

AI短视频创作管线 v17

功能概述

AI短视频创作管线 v17是一项面向实际任务的技能,主要用于从想法到成片的全流程: 用户提出想法 → 脚本设计 → 人工确认 → 自动制作;用户只需关注内容创作,所有技术细节(分段、帧数、编码、片段铺满)由 agent 自动处理;

核心要点

  • 🎬 创作工作流(4阶段);
  • Phase 1: 需求收集;
  • 用户提出想法后,agent 自行判断是否需要补充信息:;

使用与执行

自动判断需要补充的场景:;用户只给了极简描述("做个关于孤独的视频")→ 需要补。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。

结果检查与注意事项

实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

AI短视频创作管线 v17

从想法到成片的全流程:用户提出想法 → 脚本设计 → 人工确认 → 自动制作。

用户只需关注内容创作,所有技术细节(分段、帧数、编码、片段铺满)由 agent 自动处理。

🎬 创作工作流(4阶段)

Phase 1: 需求收集

用户提出想法后,agent 自行判断是否需要补充信息:

自动判断需要补充的场景:

  • 用户只给了极简描述("做个关于孤独的视频")→ 需要补充内容方向、受众、时长偏好
  • 用户未指定音色 → 默认使用大因先生(适合旁白/认知类),不用问
  • 用户未指定风格 → 默认写实电影质感,不用问
  • 用户明确说了完整文稿 → 跳过此阶段,直接进入 Phase 2

不需要问的: 音色(默认大因先生)、分辨率(默认720P)、帧率(默认24fps)、字幕样式(默认底部定位+四向描边)、视频片段(默认自动铺满)、文稿风格(自动匹配,见下文) y_ratio=0.85(底部85%位置,多行向上扩展) 需要确认的: 内容方向、目标受众、总时长预期、是否有特殊风格要求

📝 文稿风格系统

目录: ~/.openclaw/skills/ai-video-pipeline/styles/

每个风格模板包含:人设、叙事结构、句式模板、范例片段、禁止事项。

可用风格:

标签 风格 适用场景 语速
cognitive 认知拆解 职场/社会现象/权力结构/潜规则 200-220字/分
emotional 情感共鸣 人生感悟/关系/成长/内心独白 180-200字/分
deepread 深度解读 行业分析/政策/趋势/商业逻辑 210-230字/分

自动匹配规则: 根据用户话题中的关键词自动选择风格(匹配规则见各模板文件头部)。用户也可手动指定。

使用流程:

  1. 用户给话题 → agent 读取匹配的风格模板
  2. 按模板规则先整理「角度与痛点」(表面现象/痛点/角度/不敢说的话/突破方向),发用户确认
  3. 确认后用模板的句式模板完全重写文稿(不基于旧稿改)
  4. 用户标注哪里不像人话 → 针对性修改,通常2-3轮收敛

⚠️ 重要:不要跳过角度整理直接写文稿。先整理后确认再写。

Phase 2: 脚本设计

agent 根据需求完成脚本设计,输出完整的制作方案供用户确认:

方案格式:

📋 制作方案

📹 整体:约 XX 秒,X 个段落
🎵 音色:大因先生(旁白风格)
🎞️ 动画:即梦AI自动铺满(每个段落一个动画片段)

📝 脚本:
---
[段落1]

[段落2]

[段落3]
---

💰 预估成本:约 ¥X(即梦AI ¥0.28/秒 × 预估总秒数)

确认后开始制作。有修改意见请直接说。

脚本设计规则:

  • 每段 15-35 字(确保单段 ≤ 10s),段落间空行分隔
  • 总时长控制在 30-90 秒(短视频最佳区间)
  • 不要为每个段落手动写即梦AI prompt — 自动铺满模式会用段落原文作为 prompt

Phase 3: 人工确认

  • 等待用户明确确认("可以"、"开始"、"确认"等)
  • 用户可提出修改:调整脚本内容、换音色、改风格、增减段落
  • 修改后重新展示方案,再次等待确认
  • 未确认前不执行任何制作操作

Phase 4: 自动制作

确认后,agent 调用 build_video.py 一键生成:

cd /tmp/video-poc && python3 -u ~/.openclaw/skills/ai-video-pipeline/scripts/build_video.py script.txt -o output.mp4

管线自动执行(无需 agent 手动编排):

  1. TTS:播客API 生成语音 + 字幕时间轴(自动缓存 subs.json,重跑跳过)
  2. BGM 混音:自动选择 BGM(35% 音量,2s 淡入淡出),ffmpeg 混合
  3. 即梦AI视频片段:每个段落自动生成一个动画片段,铺满整个时长(用段落原文作 prompt)
  4. 视频合成:预提取帧 + frame_map + 字幕叠加 → MP4
  5. 通过飞书发送 MP4 给用户

⚠️ 耗时较长:即梦AI 串行生成 ~30s/clip,总耗时 = 30s × 段落数 + ~2min合成

agent 在制作期间的职责:

  • 执行 build_video.py 命令(后台运行)
  • 定期 poll 进度,给用户反馈
  • 完成后自动发送视频

发送格式:

🎬 视频制作完成!

时长:XX秒 | 段落:X个 | 大小:XXMB
视觉:即梦AI动画 × N(自动铺满)
成本:约 ¥X

技术参考

环境变量(~/.config/openclaw/gateway.env)

变量 用途
VOLC_APP_ID 火山播客API
VOLC_ACCESS_KEY 火山播客API
VOLC_APP_KEY 火山播客API
VOLC_ACCESS_KEY_ID 即梦AI IAM
VOLC_SECRET_KEY 即梦AI IAM
MINIMAX_API_KEY MiniMax 音乐生成

模块结构

~/.openclaw/skills/ai-video-pipeline/
├── scripts/
│   ├── build_video.py      # 入口,一键构建(v17)
│   ├── tts.py              # 火山播客API TTS
│   ├── bgm.py              # BGM 选择 + ffmpeg 混音
│   ├── subtitle.py         # 字幕渲染(PIL 底部定位+四向描边)
│   ├── compose.py          # 视频合成(预提取帧 + frame_map)
│   ├── clips.py            # 即梦AI 片段生成编排(调用 jimeng_video)
│   ├── jimeng_video.py     # 即梦AI 文生视频 API 封装
│   └── asr.py              # FunASR 字幕时间轴对齐(原文标点分句)
├── styles/                 # 文稿风格模板(自动匹配)
│   ├── cognitive.md        # 认知拆解(职场/社会现象/潜规则)
│   ├── emotional.md        # 情感共鸣(人生感悟/关系/成长)
│   └── deepread.md         # 深度解读(行业分析/趋势/商业逻辑)
└── bgm/                    # BGM 背景音乐

Python API

from scripts.build_video import build

# ⭐ 推荐:自动铺满模式(每个段落一个动画片段)
output, subs = build(script_text, "output.mp4", work_dir="/tmp/video-poc")
# video_clip_configs 默认 "auto",自动为每个段落生成即梦AI片段

# 手动指定片段配置(可选,一般不需要)
output, subs = build(
    script_text, "output.mp4",
    video_clip_configs=[
        {"prompt": "描述文字", "mode": "t2v_720p"},
    ]
)

# 仅 TTS + BGM + 字幕(不要动画片段)
output, subs = build(script_text, "output.mp4", video_clip_configs=[])

CLI

# 自动铺满(默认)
python3 build_video.py script.txt -o output.mp4

# 不生成动画片段
python3 build_video.py script.txt -o output.mp4 --no-clips

# 仅生成音频
python3 build_video.py script.txt --tts-only

可用音色

名称 ID 风格
大因先生 zh_male_dayixiansheng_v2_saturn_bigtts 沉稳旁白(⭐ 默认)
咪仔 zh_female_mizaitongxue_v2_saturn_bigtts 清新女声
刘飞 zh_male_liufei_v2_saturn_bigtts 活力男声

BGM 背景音乐

策略:本地优先 → MiniMax 动态生成 → 自动复用

  1. 优先本地:检查 bgm/ 目录,按风格关键词匹配已有 MP3
  2. 无匹配则生成:调用 MiniMax music-2.5+ 生成纯音乐(is_instrumental: true)
  3. 自动复用:生成的 BGM 自动存入 bgm/,下次同风格直接复用

支持的风格标签:

标签 风格 默认 prompt
lofi lo-fi chill / 咖啡馆 lo-fi instrumental, chillhop beat
calm 安静 / 沉思 calm, 轻柔, 简单钢琴+轻鼓点
dark 暗调 / 深沉 / 紧张 dark ambient, 电影氛围
uplifting 轻快 / 阳光 轻快, 阳光, 节奏明快
piano 简约钢琴 minimal piano, 干净留白
corporate 商务 / 科技感 简洁现代

使用方式:

# 指定风格(本地优先,无匹配则 MiniMax 生成)
output, subs = build(script_text, "output.mp4", bgm_style="lofi")
# 指定 BGM 风格标签(本地优先,无匹配则 MiniMax 生成)

# 自定义 prompt 生成
from bgm import generate_bgm
path = generate_bgm("暗调电子, 中等节奏, 紧张感", style_tag="dark")

# 手动添加本地 BGM
# 下载 MP3 → 放入 bgm/ 目录(文件名包含风格关键词即可自动匹配)

混音参数(已锁定):

  • 音量:35%(衬托旁白但不抢戏)
  • 淡入/淡出:各 2 秒
  • 循环播放至音频结束

MiniMax API 说明:

  • 超时:500 秒(API 请求 + ffmpeg 混音)
  • 模型:music-2.5+(纯音乐模式)
  • API Key:MINIMAX_API_KEY(配置在 gateway.env)
  • 生成耗时:约 30-60 秒
  • 无水印记号:aigc_watermark: false

成本估算

时长 段落数 即梦AI成本
30s ~5-7 ¥8-10
60s ~10-14 ¥17-24
90s ~15-20 ¥25-35

即梦AI 720P:¥0.28/秒(5秒=¥1.4/clip),串行生成。

限制

  • 即梦AI帧数范围 121241(单段 510 秒)
  • 播客API每轮≤300字
  • 即梦AI免费并发限制1(串行生成,~30s/clip)
  • BGM 目前 2 首本地 + MiniMax 动态生成(本地优先)

相关专题

更多
python升级pip
python升级pip

本专题整合了python升级pip相关教程,阅读下面的文章了解更多详细内容。

2025.07.23

2487

16

pip设置清华源
pip设置清华源

设置方法:1、打开终端或命令提示符窗口;2、运行“touch ~/.pip/pip.conf”命令创建一个名为pip的配置文件;3、打开pip.conf文件,然后添加“[global];index-url = https://pypi.tuna.tsinghua.edu.cn/simple”内容,这将把pip的镜像源设置为清华大学的镜像源;4、保存并关闭文件即可。

2024.12.23

5722

11

更新pip版本
更新pip版本

更新pip版本方法有使用pip自身更新、使用操作系统自带的包管理工具、使用python包管理工具、手动安装最新版本。想了解更多相关的内容,请阅读专题下面的文章。

2024.12.20

4243

6

pip安装使用方法
pip安装使用方法

安装步骤:1、确保Python已经正确安装在您的计算机上;2、下载“get-pip.py”脚本;3、按下Win + R键,然后输入cmd并按下Enter键来打开命令行窗口;4、在命令行窗口中,使用cd命令切换到“get-pip.py”所在的目录;5、执行安装命令;6、验证安装结果即可。大家可以访问本专题下的文章,了解pip安装使用方法的更多内容。

2023.10.09

1870

5

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

0

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

0

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

0

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

0

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

0

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 安装指南
Conan 2 安装指南

共0课时 | 0人学习

Python虚拟环境官方教程
Python虚拟环境官方教程

共0课时 | 0人学习

Python venv官方模块文档
Python venv官方模块文档

共0课时 | 0人学习