6月23日,国内首份面向高考志愿填报场景的ai能力评估报告——《高考志愿ai测评基准》正式发布。该报告由友松实验室独立编制,以千问高考志愿填报agent为唯一测评对象。测评数据显示,千问在多项核心指标上已与人类志愿咨询师持平,且在系统稳定性、答案精确性、结构化输出能力及响应效率等方面展现出明显优势。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

友松实验室是一支专注于人工智能与教育决策交叉研究的独立科研团队,长期深耕大模型能力评测、AI在教育场景中的落地应用,以及学生升学过程中涉及的信息获取、认知加工与决策机制等关键问题。其研究成果已被多所高等院校及科研院所采纳应用。本次发布的测评基准,致力于为当前快速发展的高考志愿类AI产品构建一套公开透明、结果可复现、框架可延展的标准化评估体系,并清晰界定AI在现阶段所能胜任的具体任务边界。
鉴于千问高考Agent依托夸克长达8年的高考服务数据沉淀与实战经验打造,在产品设计逻辑、历史数据厚度及用户覆盖广度等方面具备典型行业代表性,本报告将其设为首个被测对象。作为对照组的人类专家共53位,均为一线志愿填报咨询师,平均从业年限达4.6年。
测评体系涵盖四大核心模块:高考志愿基本事实与政策规则理解、模拟志愿填报实操、开放式问答交互、个性化志愿推荐报告生成,全面覆盖考生及家长从信息检索、政策解读,到方案设计、最终决策的完整流程。
具体结果如下:在44道标准化客观题测试中,千问实现满分通关,准确率100%,而人类咨询师平均得分为89.3%;在模拟填报任务中,千问生成的志愿方案包含6个有效录取机会,全程无明显偏好冲突,并精准匹配事后回溯认定的最优解,人类咨询师平均达成5.3个有效录取志愿;在开放式咨询环节,评审专家对100组匿名回答进行盲评,其中58次更倾向选择千问版本;其输出内容“可直接面向学生与家长展示”的比例达56.0%,显著高于人类咨询师的33.0%,尤其在专业发展路径解析、潜在风险提示及语言表达清晰度方面表现更为稳健。
报告指出,在本次设定的测评任务范围内,千问的整体表现已达到资深志愿咨询师的专业水准,尤其在稳定性、准确性、结构化表达与响应时效等维度具备突出优势。
但报告亦强调,人类咨询师的核心价值依然不可替代。例如,在涉及家庭经济预期、区域就业趋势等需深度结合个体现实条件审慎研判的议题上,人工建议更具现实贴合度;而在亲子沟通协调、价值观权衡等软性决策场景中,即便AI能输出高度结构化的方案,仍无法取代真实人际互动中所蕴含的理解力、共情力与判断弹性。
报告建议:AI应聚焦于高效执行信息核查、资料整合与初步方案筛选等标准化任务;人类咨询师则可将更多精力投入家庭对话引导、价值排序协助及个性化适配判断等高阶环节。唯有AI与人类协同互补,方能真正推动志愿填报既提升科学性与效率,又切实回应考生及其家庭的真实诉求。











