验证agent space模型输出需穿透推理链每步,结合可观测性日志与json schema校验:trace页面核对action/observation一致性;schema强制校验工具入参类型与格式;人工对比a/b版本需勾选任务、选评估标准、逐维度打分并导出报告。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要验证Agent Space中模型输出结果是否符合业务预期,不能只看最终答案对不对,必须穿透到推理链每一步的工具调用、状态转换和中间判断是否合理。这需要结合可观测性数据与结构化校验双轨并行。
查看完整执行Trace日志
登录AgentLoop控制台 → 进入对应AgentSpace → 点击「运行历史」→ 找到目标任务ID → 点击右侧「详情」按钮。Trace页面会按时间顺序展示从规划(Thought)→ 工具调用(Action)→ 观察结果(Observation)→ 再规划的完整循环链条。
注意:每一步的输入Prompt、模型原始输出、工具入参、API返回值、耗时、Token用量都以独立区块呈现,【务必核对Observation字段是否与Action中声明的工具预期返回格式一致】。若某次HTTP请求返回了503错误但Observation里却显示“成功”,说明结果解析层已失效,需立即检查流式解析器配置。
用JSON Schema强制校验工具输入
方法一:在Tool Use API定义阶段,为每个工具绑定严格JSON Schema。例如编辑文件工具必须包含old_string、new_string、file_path三个必填字段,且file_path类型为string、格式为绝对路径。
方法二:在Agent执行链路中插入Schema校验节点。当模型输出工具调用参数后,不直接发送请求,而是先交由Ajv校验器验证。校验失败时,错误信息会包含具体字段名、缺失项、类型不符等细节,直接注入下一轮Prompt供模型修正。
这一步不可跳过——模型常把相对路径如"./config.yaml"写进file_path字段,而执行防护层只允许绝对路径。一旦绕过Schema校验直接执行,可能触发越权写入。
人工比对两个版本的推理质量差异
第一步:在运行历史面板中勾选A、B两个待比对的任务版本。
第二步:点击「对比评估」→ 选择已创建的评估标准(如准确性、完整性、工具调用效率)。
第三步:逐维度打分。系统会自动高亮两版在相同步骤中的输出差异,例如:A版在第3步调用数据库查询时漏掉了WHERE条件,B版补全后返回结果条数从127变为9;此时「准确性」维度应给B版打5分、A版打2分。
第四步:点击「导出对比报告」,PDF中会包含带时间戳的Trace片段截图、评分依据摘要、以及各步骤Token消耗对比柱状图。











