openclawai通过五维自动评分机制评估回答质量:一、语义一致性校验(余弦相似度<0.65降权);二、事实性核查(实体验证失败扣0.8分);三、冗余抑制(句间jaccard>0.72每对扣0.3分);四、安全过滤(匹配高危模式即0分阻断);五、结构完整性(缺子问题回应扣0.5分,缩写未定义扣0.2分)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用OpenClawAI时希望了解其对模型生成回答的可信度与准确性判断依据,则需关注其内置的多维度自动评分机制。该机制不依赖人工干预,而是通过预设规则与实时计算对每次响应进行结构化打分。以下是OpenClawAI评估模型回答质量的具体方式:
一、语义一致性校验
该模块检测模型输出是否与用户提问的核心意图保持逻辑连贯,避免答非所问或信息偏移。系统通过双向注意力匹配提问与回答的关键词嵌入向量,并计算余弦相似度阈值。
1、提取用户问题的BERT编码向量,归一化处理。
2、对模型生成的回答进行相同编码与归一化。
3、计算两向量夹角余弦值,低于0.65视为语义断裂,触发降权标记。
二、事实性核查(Fact-Checking)
系统调用轻量级知识图谱快照,在本地缓存中比对回答中提及的实体、时间、数值等硬性信息是否与权威数据源一致。
1、识别回答中所有命名实体(如人名、地名、机构名、日期、百分比)。
2、对每个实体发起三跳以内的知识图谱路径检索。
3、任一实体无法在可信子图中验证,即标记为“待核实”并扣减0.8分(满分5分制)。
三、冗余与重复抑制评分
该机制防止模型通过堆砌同义句、循环解释或无意义填充来延长回答,聚焦信息密度与表达效率。
1、将回答按句子切分,提取每句的TF-IDF加权词干集合。
监控一个或多个 GitCode 仓库的 PR,通过 OpenClaw Gateway 自动执行 AI 审查,发布 PR 评论,并发送钉钉和企业微信通知。
2、两两计算Jaccard相似度,构建相似句对矩阵。
3、若任意两句相似度超过0.72,每对扣除0.3分,累计上限为1.5分。
四、安全性与合规性过滤
系统在输出前执行实时策略规则扫描,涵盖敏感词库匹配、指令遵循度检测及越狱尝试识别。
1、加载动态更新的政策规则集(含47类违规模式正则表达式)。
2、对回答全文执行多层NFA状态机匹配。
3、匹配到任一高危模式,直接判定为0分且阻断返回。
五、响应结构完整性评估
该模块分析回答是否具备清晰的问题覆盖结构,包括是否回应全部子问题、是否存在未定义缩写、是否提供必要上下文锚点。
1、解析提问中的疑问词分布(如“如何”“是否”“多少”“原因”),统计子问题数量。
2、扫描回答中对应解答段落的起始信号词(如“步骤如下”“主要原因有三点”“答案是”)。
3、每缺失一个子问题的显式回应,扣0.5分;未展开缩写且首次出现即无全称,额外扣0.2分。









