必须开通m3多模态专属权限并使用multimodal-endpoint才能调用minimax m3原生多模态能力;需勾选「启用多模态输入通道」,获取专用地址,请求体中用image_url或video_url传入公网可访问的图文/视频资源。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在七牛云MaaS平台快速调用MiniMax M3的原生多模态能力(支持图片+视频联合输入、图文推理、桌面操作指令解析),必须绕过通用API网关直连专用多模态路由,否则将默认降级为纯文本接口。
开通M3多模态专属调用权限
登录七牛云控制台→进入【AI服务】→点击【MaaS模型市场】→在搜索框输入“MiniMax M3”→找到官方认证的「M3-1M-Multimodal」模型卡片→点击【立即开通】→勾选「启用多模态输入通道」并提交审批。
【必须勾选此项,否则后续上传图片/视频将被静默丢弃】
审批通常在2分钟内完成,系统会自动为账号分配一个独立的 multimodal-endpoint 地址,形如 https://m3-mm.your-region.qiniuapi.com/v1/chat/completions。
构造支持图文混合的请求体
使用 curl 或 Postman 向上一步获取的 multimodal-endpoint 发送 POST 请求,Header 中必须包含:Authorization: Bearer <your-api-key></your-api-key> 和 Content-Type: application/json。
Body 内容需严格采用如下结构:
```json
{"model": "minimax-m3-1m-multimodal",
"messages": [
{"role": "user", "content": [
{"type": "text", "text": "请分析这张截图里的报错信息,并给出修复建议"},
{"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}}
]},
{"role": "assistant", "content": "已识别到 CUDA kernel launch 失败..."}
],
"max_tokens": 2048}
```
注意:image_url 必须是公网可直访的 HTTPS 地址;本地文件需先通过七牛云对象存储上传并开启公开读权限,再填入生成的外链。
验证视频理解能力(三步实操)
第一步:将一段时长≤90秒、分辨率≤1080p 的 MP4 视频上传至你的七牛云 bucket,获取公开 URL;
第二步:复用上一节的 multimodal-endpoint,但把 content 数组中的 image_url 替换为 video_url,且 type 改为 "video_url";
第三步:发送请求,观察返回中是否包含对视频关键帧动作、UI变化、文字叠加层的描述——若返回内容仅含“无法处理视频格式”,说明你误用了普通 endpoint,必须退回第一步确认开通的是多模态专属权限。











