评测编码智能体,以往总在几块互不相通的场域里各自为战——修 bug 的盯着 swe-bench,搞前端的刷 design2code,而生产环境的真实基准往往闭门谢客、不对外公开审计。腾讯此次将四大方向整合统一,正式推出名为 workbuddy bench 的多领域综合评测套件,相关论文已发布于 arxiv。它最“较真”的地方,并非题量庞大,而在于每一道题都从源头上杜绝“背答案”的可能。
整套基准覆盖四个实际工作场景:代码(仓库级软件工程)、网页(前端交付物)、办公(多文档协同业务流程)与安全(红蓝对抗实战)。各子集任务数分别为 80、70、50、60 道,总计 260 题。关键在于,所有题目均非源自公开题库的简单改写,而是从真实的代码提交记录、Pull Request 内容或一线业务需求中“逆向还原”,再经人工精炼为简明、口语化、带角色代入感的自然语言请求。如此一来,提示词无法通过搜索引擎匹配到原始 PR 或 commit 线索——你搜不到,自然无从背起。由于整个数据集完全开源(含任务目录、环境镜像、评估工具、测试用例及参考实现),其抗污染能力依赖的是这种构造逻辑与严格的版本控制机制,而非将题目锁进黑箱。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

四个子集采用统一的任务目录结构,但验证方式彼此独立:代码类以隐藏测试用例通过率计分;网页类融合规则校验、LLM/VLM 多模态评判及智能体行为路径分析,且要求交付制品必须落在声明路径内、禁止访问实时互联网;办公类采用确定性规则检查为主、辅以基于证据链的 LLM 判定,规则权重区间为 0.70–0.95;安全类则直接调用确定性 scoring.py 脚本执行三次取均值,全程不引入大模型作为裁判。该子集还部署了五重反作弊机制——禁用字面量匹配扫描、输入变量重命名、测试用例覆盖篡改、依赖项编码混淆、低权重干扰诱饵;其中红队任务 38 题、蓝队 22 题,白盒审计锚定 binutils、curl、nginx 等真实 CVE 漏洞案例。
任务构建遵循标准化流水线:来源采集 → 改写为真实用户请求 → 组装运行时工作空间 → 回合结束后隔离评估资产 → 独立目录打包归档,全程不接触任何用户隐私数据。代码类任务预设五类角色(开发者、算法工程师、产品经理、QA、运维),安全类亦赋予专业身份设定,且刻意保留信息缺口——不明确指出目标文件、匹配模式或边界条件,迫使智能体主动补全上下文。所有评分所需资产均在智能体运行完毕后才注入,全程对其不可见。
评测全程在隔离容器中执行,模型推理与沙箱环境物理分离;默认框架为 CodeBuddy Code,同时支持 Claude Code;推理参数设为高努力度(high-effort),上下文窗口扩展至 200k tokens,并强制禁用 WebSearch 与 AskUserQuestion 功能。此举至关重要——切断联网检索能力,正是为了实证其抗污染设计是否真正有效。
排行榜横向对比多家主流模型家族(分数区间 0–100,按思考模式统计,三次运行取平均)。Claude Opus4.8 在代码、网页、办公、安全四大类中多数登顶,斩获五个单项第一;GLM-5.2 在 security 双榜(红队/蓝队)均拔得头筹;GPT-5.5 则摘得 office cc 类别桂冠。框架差异亦显著影响表现——安全子集排名变动最为剧烈,平均绝对位移达 8.6 名;Claude Opus4.8 在 cc 框架下共拒答 13 次,而 GPT-5.5 在 cbc 框架下仅拒答 2 次。效率维度上,GPT-5.5 输出 token 数最少却保持高分;DeepSeek-V4-Pro 在代码类任务中平均耗时 44 轮,输入输出 token 均处高位,体现出更强的“探索性开销”。
本研究由腾讯多个实验室联合完成,署名单位包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy 团队及云鼎安全实验室(Yunding Security Lab)。团队亦坦诚指出当前局限:代码子集以 Python 为主,跨语言覆盖不足;开源本身带来潜在爬取与污染风险,需依赖版本管理缓解;评判器固有偏差尚未量化;办公类任务目前聚焦文本处理,暂未纳入 OCR 识别与 GUI 交互能力。后续计划包括网页评分标准校准、公开榜单持续扩充。对于一个致力于将“真实工作分布”具象化为可测考场的评测体系而言,WorkBuddy Bench 已然敞开大门。











