6月25日消息,高德行中智能部团队近日在arxiv平台发布一篇新论文,正式推出面向开放式对话场景的自进化式评估框架——growloop。该框架以少量人工标注的种子样本为起点,将难以量化的主观人类判断显性化、结构化为可理解、可追溯的评估规则,并能随大模型能力演进与人类偏好迁移,同步实现评估规则与测试用例的动态协同更新。
GrowLoop的设计哲学包含三大要点:尊重评估中的合理分歧,要求共识性案例必须达成人机判断一致,而分歧性案例只需落在人类评判的合理区间内;采用启发式学习范式,借助大语言模型智能体,将约50条原始人工标注高效提炼为逻辑清晰、语义可解释的评估规则;构建“规则—用例”双向驱动机制:规则指导高质量测试用例生成,新用例则反向检验并暴露现有规则覆盖盲区,推动规则持续迭代。
实证结果表明,在355组模型输出配对评估任务中,由GrowLoop赋能的AI评判员展现出卓越性能:Tie-aware准确率达0.78,Pair-Acc达0.87,Spearman相关系数高达+0.78,全面超越当前主流评估方法;同时具备强诊断能力,可识别出人类标注员未察觉的潜在缺陷,并对不同能力水平的对话模型实现精准分层区分。
Map RTOS SDK - 高德地图嵌入式 Map SDK 接入助手,支持栅格/矢量 Map 地图渲染、覆盖物绘制、轨迹导航及适配器实现指南
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜











