要用腾讯混元实现图生图必须调用api,控制台仅支持基础demo;需准备512×512至1024×1024的jpg/png/webp参考图,提示词须明确“保留项”与“变更项”;获取密钥绑定qcloudaiartfullaccess策略;调用时image参数须为base64编码,referencetype=1为默认主体参考模式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要用腾讯混元实现图生图——即上传一张参考图,再结合文字描述生成风格一致或内容重构的新图像,必须走API调用路径,控制台在线体验页仅支持文生图和基础图生图Demo,不开放参数精细调控与批量处理能力。
准备参考图与提示词
确保参考图是JPG、PNG或WEBP格式,尺寸建议在512×512至1024×1024之间。过小会导致细节丢失,过大可能触发接口超时或被自动缩放,影响主体识别精度。
提示词需明确区分“保留项”和“变更项”。例如原图是街拍人像,想转水墨风+加飞鸟背景,提示词应写成:“水墨画风格,人物保留,背景替换为淡墨渲染的飞鸟掠过山峦”,而不是笼统写“水墨风格”。【混元图生图默认优先保留构图与主体结构,若提示词未强调保留某元素,模型可能重绘甚至删减】
获取密钥并配置环境
登录腾讯云控制台 → 进入CAM访问管理 → 找到已创建的子用户(或主账号)→ 点击“授权策略” → 搜索并绑定 QcloudAIARTFullAccess 策略。
进入密钥管理页 → 创建新密钥 → 保存好 SecretId 和 SecretKey。注意:SecretKey仅在创建时可见,关闭页面后无法再次查看,务必立即复制存档。
调用图生图API(同步方式)
方法一:使用API 3.0 Explorer在线调试(推荐新手)
① 访问API 3.0 Explorer - 图生图接口页;
② 在“请求参数”区域,点击“上传图片”按钮,选择本地参考图 → 自动转为Base64编码填入 Image 参数;
腾讯云通用文字识别(高精度版)技能包。用户发送/粘贴图片、提供图片URL或要求识别图片文字时自动调用。支持中文、英文、中英混合、数字及特殊符号的检测与识别,返回文字框位置与内容。适用于文字较多、版式复杂、准召率要求高的场景。
③ 在 Prompt 输入框填写中文提示词,勾选 RspImgType=Base64;
④ 点击“发起请求”,成功后返回 JSON 中的 ResultImage 字段即为新图Base64字符串。
方法二:Python脚本直调(适合集成进工作流)
安装腾讯云SDK:pip install tencentcloud-sdk-python;
构造请求体时,必须将参考图读取为bytes → base64.b64encode → decode('utf-8') → 赋值给 Image 字段;【若直接传文件路径或URL,接口会报错InvalidParameter.Image】
设置参数 ReferenceType=1 表示启用“参考主体”模式(默认),ReferenceType=2 启用“参考轮廓”模式(对线条稿更有效)。
解析并保存返回图像
从API响应中提取 ResultImage 字符串,用Python执行 base64.b64decode 解码 → 写入二进制文件即可生成图片。
这一步操作起来很简单,直接把解码后的字节流写进 .jpg 或 .png 文件就行,不需要额外库或转换步骤。










