骡子快跑需切换至super agent模式、授权浏览器媒体权限、上传合规图片并按语义锚点输入指令,方可启用图文联合推理;高级场景还需开启“图文协同理解”开关。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用骡子快跑时尝试上传图片并配合文字指令执行任务,但系统未按预期识别图像内容或融合图文信息生成结果,则可能是由于当前输入通道未正确激活多模态解析模块。以下是验证与启用该能力的具体操作路径:
一、确认账户所处运行模式
骡子快跑的多模态输入能力仅在Super Agent模式下默认启用,Computer模式默认关闭视觉理解组件以保障长期任务稳定性。切换模式将直接影响图文混合处理权限。
1、登录骡子快跑官网,在右上角点击用户头像进入设置面板。
2、在“工作形态”选项中,选择Super Agent而非Computer。
3、页面自动刷新后,界面左下角应显示“当前:Super Agent|支持图像+文本联合推理”提示。
二、检查浏览器端媒体权限与上传格式
系统需获得实时图像访问权,并仅接受经压缩优化的通用格式,非标准编码或高分辨率原始文件将触发静默拦截。
1、在Chrome或Edge浏览器地址栏左侧点击锁形图标,展开站点设置。
2、将“相机”与“图片上传”两项权限手动设为允许。
3、上传前使用在线工具将图片转为JPEG或PNG格式,尺寸控制在1920×1080像素以内,单文件小于8MB。
三、调用图文混合指令的标准语法结构
骡子快跑不依赖传统prompt工程,但需遵循语义锚点规则:图像必须作为首条输入项,文字指令须含明确动作动词与目标对象,禁止模糊指代。
1、点击输入框旁的“+”图标,从本地选择一张待分析图像。
2、图像上传完成后,在同一输入框内紧接着输入指令,例如:“把这张产品图里的主色调提取出来,生成5组符合Pantone色卡编号的配色方案”。
3、按下回车键,系统将在3秒内返回含色值表格与可视化色块的结果页。
四、启用高级图文联合建模开关
部分垂直场景(如设计稿解析、教育题图识别)需手动开启增强型多模态引擎,该开关默认关闭以节省云端算力资源。
1、在Super Agent模式下,点击输入框右侧的齿轮图标打开高级设置。
2、找到“图文协同理解”选项,将其状态切换为开启。
3、此时系统将加载额外视觉语言对齐模型,可处理带手写批注的扫描件、含多区域标注的UI截图、分镜脚本类图文混排文档。
五、验证多模态响应是否生效
系统返回结果若包含图像区域热力图、文字描述与原始图叠加层、或跨模态推理链路说明,则表明图文混合处理已成功激活。
1、向输入框发送测试指令:“分析这张餐厅菜单照片,列出所有含辣椒图标的菜品名称及对应辣度等级”,并附带一张真实菜单图。
2、观察返回内容是否出现带红色方框标注的菜品位置、表格形式的辣度分级、以及‘未识别图标’的明确提示行。
3、若返回结果中存在上述三项要素,则证明多模态通道完整就绪。











