agent space通过结构化评估标准对两个完成的agent运行快照进行客观对比:先创建含2–6个互斥可验证维度的标准,再选取有效记录并排展示轨迹,逐维人工打分(1–5分),实时输出平均分、差值及裁决结果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在Agent Space中对比不同模型的能力,核心是利用其内置的评估标准体系对两个运行快照进行结构化打分,避免主观判断导致的偏差。
创建可复用的评估标准
进入Thread Playground → 点击Evaluation Rubric Editor → 新建标准。每个标准必须包含2–6个互斥维度,例如“工具调用准确性”和“上下文保持完整性”不能合并为一个维度,否则评分将失去独立性。
为每个维度填写明确名称与可选描述,比如“多步规划合理性”可注明:“是否在未获得必要信息前跳过依赖步骤”。【描述必须可验证,禁止使用‘较好’‘基本满足’等模糊表述】
保存后,该标准即可在任意对比任务中调用,确保不同时间、不同人员评估结果具备一致性。
使用 dm.bot API 进行加密的智能体间消息传递。适用于向其他智能体发送私信、发布公开消息、查看收件箱、管理群组或设置 webhook。触发词包括 dm.bot、智能体消息或加密通信。
选取待对比的两个Agent运行快照
在运行历史面板中,勾选任意两次执行记录(支持跨模型、跨提示词、跨工具配置)。系统自动捕获完整快照:系统提示词原文、全部消息轮次、工具调用序列、模型输出token数、执行耗时。
注意:必须选择已完成且无中断的运行记录;若其中一次因超时或报错终止,该快照不可用于正式能力对比。
点击“Compare”按钮,界面将并排展示A/B两版执行轨迹,左侧为基准版本,右侧为待测版本。
基于标准逐维人工打分
第一步:在对比视图顶部选择已创建的评估标准;
第二步:系统按顺序展开每个维度,显示A/B两版在该维度下的原始输出片段(如工具调用日志、关键响应句);
第三步:对照维度定义,分别为A和B打1–5分;
第四步:提交后,页面实时显示:A平均分、B平均分、B相对A的差值(如+0.8)、人工裁决结果(B更好/平局/失败)。
打分过程中,若发现某维度下两版均未覆盖评估要点(例如都未调用必需API),系统不会强制要求打分,允许留空并标注原因——这能暴露标准本身的设计盲区。










