confidence字段仅在choice和score原语响应中显式返回,noul原语用noul值替代;它表示模型对本次决策整体可靠性的校准评估,非准确率保证,需按原语类型分支提取并结合probabilities等字段综合判断。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

直接读取响应体里的 confidence 字段,它和 probabilities 或 noul 同级出现——不是额外计算,而是模型原生输出的一部分。
确认返回结构是否含 confidence
Jev 的三种提问原语中,只有 Choice 和 Score 类型会显式返回 confidence 字段;Noul 不返回独立的置信度,它的概率值 noul 本身就是校准后的判断强度(0.92 就是“有 92% 把握是”,0.08 就是“有 92% 把握不是”)。
- Choice 示例响应含:
"confidence": 0.87和"probabilities": {"urgent": 0.71, "normal": 0.25, "low": 0.04} - Score 示例响应含:
"score": 2.3、"legend": {1: "critical", 2: "high", 3: "medium"}、"probabilities": [0.12, 0.65, 0.23]、"confidence": 0.79 - Noul 示例响应只含:
"noul": 0.91,没有confidence字段
区分 confidence 和 probabilities 的含义
confidence 是模型对本次决策整体可靠性的评估,范围通常在 0–1 之间,数值越高,说明该次分类/打分所依据的状态特征越清晰、越无歧义;probabilities 是各选项的归一化分布,总和恒为 1,反映模型在给定约束下的倾向性分配。
- 高 confidence + 高 peak probability(如 0.85)→ 模型很确定且倾向明确
- 高 confidence + 均匀 probabilities(如 [0.34, 0.33, 0.33])→ 模型很确定“这状态确实难分”,但依然诚实给出分布
- 低 confidence → 状态信息模糊、矛盾或超出训练分布,此时即使某个 probability 较高,也应谨慎自动执行
在代码里安全提取置信信号
不要假设字段一定存在,需按原语类型做分支处理:
- 对 Choice/Score 请求:先检查响应中是否存在
confidence键,再读取;若缺失,说明后端未返回或请求格式异常 - 对 Noul 请求:直接用
noul值作为判断依据,无需、也不应尝试推导 confidence - 所有情况都应校验
probabilities总和是否 ≈ 1(允许浮点误差),避免下游误用被篡改或截断的响应
警惕常见误解
confidence 不是准确率保证,也不是模型“自我评分”。它是在 RLCD 训练中对齐真实结果后得到的校准指标,反映的是“当 confidence=0.8 时,长期来看约 80% 的同类决策是正确的”,但单次决策仍可能出错。
- 不能把 confidence 当作阈值过滤的唯一依据(例如只放行 confidence > 0.9 的请求)
- 不能跨原语横向比较 confidence 数值(Choice 的 0.85 和 Score 的 0.85 语义不完全等价)
- 官方明确提醒:自动执行逻辑必须结合业务风险单独验证阈值,比如 p(urgent) > 0.7 且 confidence > 0.75 才触发告警











