通过 UNITH API 创建、配置和管理 UNITH 数字人形象,价格低于 HeyGen 等,适用于用户想要创建…
UNITH 数字人类技能是一项面向实际任务的技能,主要用于使用 UNITH API 来创建、配置、更新和部署 AI 驱动的数码人类形象;{}快速概览;
该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
使用 UNITH API 创建、配置、更新和部署 AI 驱动的数字人形象(Digital Human avatar)。
UNITH 数字人是具备语音输出、自然对话与用户交互能力的 AI 形象。它将面部(头部视觉效果)、语音和对话引擎三者整合,提供托管式、可嵌入的完整体验。
基础 API 地址:https://platform-api.unith.ai
文档:https://docs.unith.ai
用户需提供以下凭据(以环境变量形式存储):
| 变量 | 说明 | 获取方式 |
|---|---|---|
UNITH_EMAIL |
账户邮箱 | 在 https://unith.ai 注册账号 |
UNITH_SECRET_KEY |
永不过期的密钥 | 进入 UNITH 控制台 → 管理账户 → “Secret Key” 区域 → 点击生成 |
⚠️ 密钥仅在生成时显示一次。若丢失,用户需删除并重新生成。
所有 API 请求均需携带 Bearer Token(有效期为 7 天)。请使用认证脚本:
source scripts/auth.sh
该脚本会校验凭据,在网络错误时自动重试,并导出环境变量 UNITH_TOKEN。若失败,将输出具体错误提示(如密钥错误、Token 过期等)。
向用户询问其希望数字人实现的功能,并据此映射至以下 5 种模式之一:
| 模式 | operationMode 值 |
适用场景 | 输出结果 |
|---|---|---|---|
| 文本转视频(Text-to-Video) | ttt |
根据输入文本生成数字人说话的 MP4 视频 | MP4 文件 |
| 开放对话(Open Dialogue) | oc |
由系统提示词(system prompt)引导的自由对话型数字人 | 托管式对话 URL |
| 文档问答(Document Q&A) | doc_qa |
数字人基于已上传文档回答用户问题 | 托管式对话 URL |
| Voiceflow | voiceflow |
通过 Voiceflow 实现结构化对话流程 | 托管式对话 URL |
| 插件(Plugin) | plugin |
通过 Webhook 接入任意外部大语言模型(LLM)或对话引擎 | 托管式对话 URL |
复杂度光谱(由简至繁):
ttt — 输入文本即输出视频,无需知识库。oc — 基于系统提示词的通用对话助手,适用于通用助理场景。doc_qa — 上传文档后,数字人仅依据文档内容作答,适用于客服/FAQ 场景。voiceflow — 支持预设对话路径的结构化交互,需拥有 Voiceflow 账户。plugin — 用户自定义对话引擎(BYO),提供最高控制权。bash scripts/list-resources.sh faces
每个面部资源具有唯一 id(创建数字人时用作 headVisualId)。面部类型包括:
请向用户展示可用面部列表,并由其选择。
bash scripts/list-resources.sh voices
语音由不同服务商提供:elevenlabs、azure、audiostack。请向用户呈现可选语音列表。语音按性能分级——响应更快的语音更适合实时对话场景。
构建 JSON 负载文件(各模式的具体 schema 参见 references/api-payloads.md),然后执行:
bash scripts/create-head.sh payload.json --dry-run # 先验证格式 bash scripts/create-head.sh payload.json # 正式创建
该脚本将校验必填字段、检查模式特定要求、在服务端错误时自动重试,并在成功后打印 publicUrl。
doc_qa 模式):上传知识文档对于 doc_qa 模式,数字人需关联一份知识文档:
bash scripts/upload-document.sh/path/to/document.pdf
该脚本会校验文件是否存在及大小是否合规,对上传操作启用更长超时时间,并提供后续操作指引。
数字人将在步骤 4 输出的 publicUrl 上线运行。用户应执行以下操作:
使用更新脚本修改任意参数(除面部外;更换面部需新建数字人):
bash scripts/update-head.shupdates.json # 从 JSON 文件批量更新 bash scripts/update-head.sh --field ttsVoice=rachel # 单字段更新 bash scripts/update-head.sh --field ttsVoice=rachel --field greetings="Hi!" # 多字段更新
bash scripts/list-resources.sh heads # 列出全部数字人 bash scripts/list-resources.sh head# 获取指定数字人详情
bash scripts/delete-head.sh--confirm # 在自动化/Agent 场景中务必使用 --confirm
此操作将永久删除数字人,不可撤销。
Agent 注意事项:调用该脚本时必须始终传入
--confirm参数。否则脚本将等待交互式确认输入,导致阻塞。
数字人支持嵌入网站或应用程序。嵌入代码片段与配置选项详见 references/embedding.md。
所有脚本均内置重试机制(指数退避)、清晰的错误信息及输入校验逻辑。
| 脚本 | 用途 |
|---|---|
scripts/_utils.sh |
通用工具函数:重试包装器、彩色日志、错误解析 |
scripts/auth.sh |
完成身份验证并导出 UNITH_TOKEN(支持 6 天 Token 缓存) |
scripts/list-resources.sh |
列出面部、语音、数字人、语言,或获取单个数字人详情 |
scripts/create-head.sh |
基于 JSON 负载文件创建数字人(支持 --dry-run 格式校验) |
scripts/update-head.sh |
更新数字人配置(支持 JSON 文件或 --field 参数方式) |
scripts/delete-head.sh |
删除数字人(含确认提示) |
scripts/upload-document.sh |
为 doc_qa 类型数字人上传知识文档 |
可通过环境变量配置行为:
UNITH_MAX_RETRIES — 最大重试次数(默认值:3)UNITH_RETRY_DELAY — 首次重试前等待秒数(默认值:2,每次重试翻倍)UNITH_CURL_TIMEOUT — curl 请求超时时间(单位:秒,默认值:30;上传时为 120)UNITH_CONNECT_TIMEOUT — 连接超时时间(单位:秒,默认值:10)UNITH_TOKEN_CACHE — Token 缓存文件路径(默认值:/tmp/.unith_token_cache;设为空字符串可禁用缓存)关于完整负载结构、全部可配置参数及各模式特性的说明,请参阅:
阅读 references/api-payloads.md # 各模式的完整请求/响应结构定义 阅读 references/configuration.md # 所有可配置参数说明 阅读 references/embedding.md # 嵌入代码与配置选项
“我想快速生成一段某人说 X 内容的视频” → 使用 ttt 模式,配置极简
“我想打造一个客服数字人” → 使用 doc_qa 模式并上传知识文档
“我想部署一位 AI 销售代表” → 使用 oc 模式,并配置销售风格的系统提示词
“我想接入我自己的大语言模型” → 使用 plugin 模式并提供 Webhook URL
“我想实现引导式新手入门流程” → 使用 voiceflow 模式并提供 Voiceflow API Key
创建前,请向用户确认以下信息:
en-US、es-ES)oc/doc_qa 模式)→ 定义数字人人格与行为规范doc_qa 模式)→ 待上传的文件voiceflow 模式)→ 来自其 Voiceflow 账户plugin 模式)→ 自定义对话引擎的 Webhook 终端地址