阶跃ai新版本已实现多模态功能落地:支持截图填报销单、会议录音生成带时间戳纪要、excel图表异常识别。其视觉理解可语义解析图表,语音-文本联合推理实现声纹分离与因果标记,图文混合推理能据菜谱图解反推采购清单并同步至企业微信。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

阶跃AI智能办公新版本在多模态理解上的实际表现,直接决定你能否用一张截图完成报销单填写、靠一段会议录音自动生成带时间戳的纪要、或让AI看懂Excel图表后指出异常数据点——这些不是概念演示,而是当前已落地的功能。
视觉理解:从“看到”到“读懂”表格与图表
打开任意含数据图表的PDF或截图,选中图片→右键→“交给阶跃AI分析”,系统自动调用Step3oVision模型。
模型会先分离文字与图形区域,再对坐标轴、图例、数据标签做语义对齐,最后输出结构化描述。例如柱状图中“Q3销售额下降12%”会被识别为事实陈述,而非仅返回“有三根柱子,中间最短”。
这一步依赖本地GPU加速,【若显卡驱动未更新至2026.06版以上,视觉解析将降级为CPU模式,耗时增加3倍且丢失细粒度标注】。
验证方式:上传一张带误差线的折线图,输入指令“标出置信区间超出阈值的点”,正确响应即表示视觉语义链已打通。
语音-文本联合推理:会议录音秒变可编辑纪要
方法一:飞书/钉钉会议结束后,点击阶跃悬浮球→“提取本次会议纪要”,自动拉取录音文件并启动Step-Audio2模型。
方法二:手动上传MP3/WAV文件,在输入框输入“按发言角色分段,标记技术术语,高亮待办事项”,模型同步执行声纹分离+术语识别+意图抽取三重任务。
关键区别在于:旧版本仅做ASR转写,新版本会在转写结果上叠加实体链接(如“K8s”自动关联集群配置文档)、因果标记(“因数据库超时→触发熔断”)、以及跨句指代消解(“它”被还原为“订单服务”)。
图文混合推理:用菜谱图解反推食材采购清单
第一步:拖入一张带步骤图的家常菜谱截图。
第二步:输入自然语言指令:“列出所有未标注但实际需要的辅料,并按超市分区排序。”
第三步:模型调用STEP3-VL-10B进行跨模态对齐——识别图中锅具材质(暗示需耐高温调料)、火候符号(判断是否需提前腌制)、成品色泽(反推酱油添加时机),最终生成带采购动线建议的清单。
第四步:点击清单末尾的“同步至企业微信采购群”,自动唤起微信客户端完成消息发送。
注意:该流程依赖MCP协议v1.2的tool_call扩展字段,【若未在高级设置中启用“多模态工具链直连”开关,此功能将不可见】。











