Generate images & videos with: Gemini 3 Pro Image (image) + Qwen Wan 2.6 (video) via one API key

Polar Sponsor
爱发电 赞助
.NET 9.0

使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。

OpenClaw Media Gen QQ AIsa API QQ 图片 图片 视频 视频 视频

功能概述

OpenClaw Media Gen QQ AIsa API QQ 图片 图片 视频 视频 视频是一项面向实际任务的技能,主要用于图片 可从 可从;图片 可从 可从 可从 可从 可从;

核心要点

  • 图片 可从;
  • 图片 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从;
  • 图片 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从 可从。

使用与执行

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。

结果检查与注意事项

执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。

OpenClaw Media Gen 🎬

用 AIsa API 一把钥匙生成图片视频

  • 图片gemini-3-pro-image-preview(Gemini GenerateContent)
  • 视频wan2.6-t2v(通义万相 / Qwen Wan 2.6,异步任务)

API 文档索引见 AIsa API Reference(可从 https://aisa.mintlify.app/llms.txt 找到所有页面)。

🔥 你可以做什么

图片生成(Gemini)

"生成一张赛博朋克风格的城市夜景,霓虹灯,雨夜,电影感"

视频生成(Wan 2.6)

"用一张参考图生成 5 秒镜头:镜头缓慢推进,风吹动头发,电影感,浅景深"

Quick Start

export AISA_API_KEY="your-key"

🖼️ Image Generation (Gemini)

Endpoint

  • Base URL: https://api.aisa.one/v1
  • POST /models/{model}:generateContent

文档:google-gemini-chat(GenerateContent)见 https://aisa.mintlify.app/api-reference/chat/chat-api/google-gemini-chat.md

curl 示例(返回 inline_data 时为图片)

curl -X POST "https://api.aisa.one/v1/models/gemini-3-pro-image-preview:generateContent" 
  -H "Authorization: Bearer $AISA_API_KEY" 
  -H "Content-Type: application/json" 
  -d '{
    "contents":[
      {"role":"user","parts":[{"text":"A cute red panda, ultra-detailed, cinematic lighting"}]}
    ]
  }'

说明:该接口的响应中可能出现 candidates[].parts[].inline_data(通常包含 base64 数据与 mime 类型);客户端脚本会自动解析并保存文件。

🎞️ Video Generation (Qwen Wan 2.6 / Tongyi Wanxiang)

Create task

  • Base URL: https://api.aisa.one/apis/v1
  • POST /services/aigc/video-generation/video-synthesis
  • Header:X-DashScope-Async: enable(必填,异步)

文档:video-generationhttps://aisa.mintlify.app/api-reference/aliyun/video/video-generation.md

curl -X POST "https://api.aisa.one/apis/v1/services/aigc/video-generation/video-synthesis" 
  -H "Authorization: Bearer $AISA_API_KEY" 
  -H "Content-Type: application/json" 
  -H "X-DashScope-Async: enable" 
  -d '{
    "model":"wan2.6-t2v",
    "input":{
      "prompt":"cinematic close-up, slow push-in, shallow depth of field",
      "img_url":"https://upload.wikimedia.org/wikipedia/commons/thumb/3/3a/Cat03.jpg/320px-Cat03.jpg"
    },
    "parameters":{
      "resolution":"720P",
      "duration":5,
      "shot_type":"single",
      "watermark":false
    }
  }'

Poll task

  • GET /services/aigc/tasks?task_id=...

文档:taskhttps://aisa.mintlify.app/api-reference/aliyun/video/task.md

curl "https://api.aisa.one/apis/v1/services/aigc/tasks?task_id=YOUR_TASK_ID" 
  -H "Authorization: Bearer $AISA_API_KEY"

Python Client

# 生成图片(保存到本地文件)
python3 {baseDir}/scripts/media_gen_client.py image 
  --prompt "A cute red panda, cinematic lighting" 
  --out "out.png"

# 创建视频任务(需要 img_url)
python3 {baseDir}/scripts/media_gen_client.py video-create 
  --prompt "cinematic close-up, slow push-in" 
  --img-url "https://upload.wikimedia.org/wikipedia/commons/thumb/3/3a/Cat03.jpg/320px-Cat03.jpg" 
  --duration 5

# 轮询任务状态
python3 {baseDir}/scripts/media_gen_client.py video-status --task-id YOUR_TASK_ID

# 等待直到成功(可选:成功后打印 video_url)
python3 {baseDir}/scripts/media_gen_client.py video-wait --task-id YOUR_TASK_ID --poll 10 --timeout 600

# 等待直到成功并自动下载 mp4
python3 {baseDir}/scripts/media_gen_client.py video-wait --task-id YOUR_TASK_ID --download --out out.mp4

相关专题

更多
Gemini 高级Prompt工程与多模态能力优化专题
Gemini 高级Prompt工程与多模态能力优化专题

PHP中文网为您提供Gemini高级Prompt工程与多模态能力优化专题。针对谷歌最新一代原生多模态大模型(如Gemini 3.5系列),我们为您系统梳理了结构化提示词构建法则(如XML标签界定、约束前置与指令后置),以及涵盖四档Thinking推理深度控制、强制自我审视与任务拆解等高级Prompt工程实战指南。

2026.06.10

60

7

如何编写高效提示词:Gemini结构化指令设计与优化指南
如何编写高效提示词:Gemini结构化指令设计与优化指南

本指南深入解析高效提示词编写技巧,聚焦结构化指令设计与参数优化。通过拆解角色设定、任务分解及约束条件,演示如何引导Gemini输出精准结果。涵盖思维链应用与迭代优化策略,助初学者掌握核心方法论,显著提升交互质量与任务完成效率。

2026.03.24

80

11

Gemini网页版实战:从文档分析到代码生成的全流程教程
Gemini网页版实战:从文档分析到代码生成的全流程教程

本教程详解Gemini网页版全流程实战,涵盖长文档深度解析、关键信息提取及复杂代码生成。通过真实案例演示,指导用户高效利用多模态交互提升工作效率。适合初学者快速掌握核心功能,从基础问答进阶至自动化办公与开发辅助,轻松释放AI生产力。

2026.03.24

105

10

什么是Gemini:核心架构解析与多模态能力入门指南
什么是Gemini:核心架构解析与多模态能力入门指南

本专题深度解析 Gemini 核心架构,涵盖混合专家模型与原生多模态设计原理。指南详解其文本、图像及代码的统一理解能力,帮助初学者建立系统性认知。通过理论结合实例,助您快速掌握模型优势与适用场景,为后续进阶开发与复杂应用奠定坚实基础。

2026.03.24

61

11

Gemini多模态Agent实战:浏览器控制与工具链指南
Gemini多模态Agent实战:浏览器控制与工具链指南

本实战指南详解构建基于 Gemini 的多模态 Agent,实现浏览器自动化控制与复杂工具链编排。通过整合视觉理解与代码执行能力,演示如何让 AI 自主导航网页、提取动态数据并操作外部 API。涵盖环境搭建、安全沙箱及任务规划策略,助开发者打造能“看”会“做”的智能助手,突破传统文本交互局限,开启全自动工作流新篇章。

2026.03.23

59

11

Gemini上下文缓存功能:如何大幅降低长对话成本指南
Gemini上下文缓存功能:如何大幅降低长对话成本指南

本指南深入解析 Gemini 上下文缓存(Context Caching)功能,助您大幅降低长对话与大规模文档处理成本。通过复用高频输入的嵌入表示,避免重复计算令牌,显著减少延迟与费用。内容涵盖缓存创建、管理及最佳实践,特别适合多轮对话、知识库问答等场景,让您在保持高性能的同时,实现极具性价比的 AI 应用部署。

2026.03.23

55

8

Gemini结构化输出JSON模式:API稳定提取数据实战
Gemini结构化输出JSON模式:API稳定提取数据实战

本实战指南详解如何利用 Gemini API 的 JSON 模式实现结构化数据提取。通过配置响应格式约束,确保模型输出严格符合预定义 Schema,彻底解决解析错误难题。内容涵盖字段定义、类型校验及异常处理,助您在信息抽取、数据清洗等场景中构建高稳定性管道,轻松将非结构化文本转化为可靠的应用数据。

2026.03.23

91

13

如何实现Gemini函数调用:Tool Use与外部工具集成教程
如何实现Gemini函数调用:Tool Use与外部工具集成教程

本教程深入解析 Gemini 函数调用机制,详解 Tool Use 配置与外部工具集成流程。从定义函数架构到处理动态参数,手把手教您连接数据库、搜索 API 及自定义服务。通过实战案例,展示如何让 AI 自主规划并执行复杂任务,突破纯文本限制,构建具备真实行动力的智能代理系统。

2026.03.23

145

11

Gemini API快速上手:Python调用generateContent完整指南
Gemini API快速上手:Python调用generateContent完整指南

本指南详解如何使用 Python 快速调用 Gemini API 的 generateContent 方法。从环境配置、密钥管理到核心代码实现,逐步演示文本生成、多模态输入及流式响应处理。包含完整示例与错误排查技巧,助开发者轻松集成 Gemini 强大能力,构建高效智能应用,开启 AI 开发新篇章。

2026.03.23

70

11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Gemini Notebook常见问题解答
Gemini Notebook常见问题解答

共0课时 | 0人学习

Gemini Notebook官方手册
Gemini Notebook官方手册

共0课时 | 0人学习