腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

聖光之護

聖光之護

2026-07-24

316人浏览

原创

评测编码智能体,以往总在几块互不相通的场域里各自为战——修 bug 的盯着 swe-bench,搞前端的刷 design2code,而生产环境的真实基准往往闭门谢客、不对外公开审计。腾讯此次将四大方向整合统一,正式推出名为 workbuddy bench 的多领域综合评测套件,相关论文已发布于 arxiv。它最“较真”的地方,并非题量庞大,而在于每一道题都从源头上杜绝“背答案”的可能。

整套基准覆盖四个实际工作场景:代码(仓库级软件工程)、网页(前端交付物)、办公(多文档协同业务流程)与安全(红蓝对抗实战)。各子集任务数分别为 80、70、50、60 道,总计 260 题。关键在于,所有题目均非源自公开题库的简单改写,而是从真实的代码提交记录、Pull Request 内容或一线业务需求中“逆向还原”,再经人工精炼为简明、口语化、带角色代入感的自然语言请求。如此一来,提示词无法通过搜索引擎匹配到原始 PR 或 commit 线索——你搜不到,自然无从背起。由于整个数据集完全开源(含任务目录、环境镜像、评估工具、测试用例及参考实现),其抗污染能力依赖的是这种构造逻辑与严格的版本控制机制,而非将题目锁进黑箱。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

四个子集采用统一的任务目录结构,但验证方式彼此独立:代码类以隐藏测试用例通过率计分;网页类融合规则校验、LLM/VLM 多模态评判及智能体行为路径分析,且要求交付制品必须落在声明路径内、禁止访问实时互联网;办公类采用确定性规则检查为主、辅以基于证据链的 LLM 判定,规则权重区间为 0.70–0.95;安全类则直接调用确定性 scoring.py 脚本执行三次取均值,全程不引入大模型作为裁判。该子集还部署了五重反作弊机制——禁用字面量匹配扫描、输入变量重命名、测试用例覆盖篡改、依赖项编码混淆、低权重干扰诱饵;其中红队任务 38 题、蓝队 22 题,白盒审计锚定 binutils、curl、nginx 等真实 CVE 漏洞案例。

任务构建遵循标准化流水线:来源采集 → 改写为真实用户请求 → 组装运行时工作空间 → 回合结束后隔离评估资产 → 独立目录打包归档,全程不接触任何用户隐私数据。代码类任务预设五类角色(开发者、算法工程师、产品经理、QA、运维),安全类亦赋予专业身份设定,且刻意保留信息缺口——不明确指出目标文件、匹配模式或边界条件,迫使智能体主动补全上下文。所有评分所需资产均在智能体运行完毕后才注入,全程对其不可见。

DeepSeek
DeepSeek

DeepSeek是一款由深度求索公司开发的免费AI助手,支持Web端和移动端使用。它拥有强大的自然语言处理能力,可进行文本对话、内容创作、代码编写、文件处理(支持图像、PDF、Word、Excel、PPT等格式)以及联网搜索。DeepSeek上下文长度达1M tokens,能一次性处理海量信息(如《三体》三部曲)。其核心优势在于完全免费、响应迅速、支持语音输入,并提供API服务,适合学习、办公和开发等多种场景。

下载

评测全程在隔离容器中执行,模型推理与沙箱环境物理分离;默认框架为 CodeBuddy Code,同时支持 Claude Code;推理参数设为高努力度(high-effort),上下文窗口扩展至 200k tokens,并强制禁用 WebSearch 与 AskUserQuestion 功能。此举至关重要——切断联网检索能力,正是为了实证其抗污染设计是否真正有效。

排行榜横向对比多家主流模型家族(分数区间 0–100,按思考模式统计,三次运行取平均)。Claude Opus4.8 在代码、网页、办公、安全四大类中多数登顶,斩获五个单项第一;GLM-5.2 在 security 双榜(红队/蓝队)均拔得头筹;GPT-5.5 则摘得 office cc 类别桂冠。框架差异亦显著影响表现——安全子集排名变动最为剧烈,平均绝对位移达 8.6 名;Claude Opus4.8 在 cc 框架下共拒答 13 次,而 GPT-5.5 在 cbc 框架下仅拒答 2 次。效率维度上,GPT-5.5 输出 token 数最少却保持高分;DeepSeek-V4-Pro 在代码类任务中平均耗时 44 轮,输入输出 token 均处高位,体现出更强的“探索性开销”。

本研究由腾讯多个实验室联合完成,署名单位包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy 团队及云鼎安全实验室(Yunding Security Lab)。团队亦坦诚指出当前局限:代码子集以 Python 为主,跨语言覆盖不足;开源本身带来潜在爬取与污染风险,需依赖版本管理缓解;评判器固有偏差尚未量化;办公类任务目前聚焦文本处理,暂未纳入 OCR 识别与 GUI 交互能力。后续计划包括网页评分标准校准、公开榜单持续扩充。对于一个致力于将“真实工作分布”具象化为可测考场的评测体系而言,WorkBuddy Bench 已然敞开大门。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
WorkBuddy AI教程合集
WorkBuddy AI教程合集

本专题整合了WorkBuddy AI入门到精通合集,阅读专题下面的文章了解更多详细内容。

2026.04.03

471

38

WorkBuddy产品概览与核心价值
WorkBuddy产品概览与核心价值

本专题将带您快速了解WorkBuddy智能办公助手。内容涵盖产品定义、核心功能概览、适用场景分析以及它如何提升团队效率。无论您是初次接触还是希望深入了解,这里都有您需要的入门知识。

2026.04.09

185

19

WorkBuddy环境搭建与部署指南
WorkBuddy环境搭建与部署指南

提供详尽的WorkBuddy安装与部署指南。无论您是在Windows、Mac、Linux桌面端,还是在服务器或云端环境进行私有化部署,本专题都将一步步指导您完成环境准备、软件下载、安装配置及首次启动,确保系统平稳上线。

2026.04.09

383

26

WorkBuddy核心功能与实操模式
WorkBuddy核心功能与实操模式

深入探索WorkBuddy的强大功能。本专题包含智能问答、文档处理、会议纪要生成、日程管理、任务协作等核心模块的操作指南与最佳实践。通过图文并茂的教程,助您快速上手,最大化发挥WorkBuddy的办公效能。

2026.04.09

333

19

WorkBuddy生态集成与API配置
WorkBuddy生态集成与API配置

指导管理员如何将WorkBuddy无缝接入现有办公生态。内容涉及企业微信、钉钉、飞书等主流平台的集成步骤,以及Webhook、API密钥配置、单点登录(SSO)设置等高级接入选项,实现统一入口,提升协作体验。

2026.04.09

450

18

WorkBuddy模型矩阵与技能扩展
WorkBuddy模型矩阵与技能扩展

揭秘WorkBuddy背后的智能引擎。本专题介绍所支持的大语言模型(LLM)类型、如何根据需求切换或配置模型,以及如何通过自定义指令、技能插件(Plugins)扩展WorkBuddy的能力边界,打造专属的智能办公伙伴。

2026.04.09

242

19

WorkBuddy安全架构与计费体系
WorkBuddy安全架构与计费体系

透明化WorkBuddy的计费模式与安全保障体系。清晰列出不同版本(免费版、专业版、企业版)的费用结构、功能差异与订阅方式;同时深入解读数据加密、访问控制、合规认证(如GDPR、ISO)等企业级安全特性,让您用得放心。

2026.04.09

154

12

WorkBuddy协作工具使用与项目管理优化实践
WorkBuddy协作工具使用与项目管理优化实践

本专题聚焦 WorkBuddy 协作工具在企业项目管理中的应用,讲解任务分配、进度跟踪、团队协作、日程管理及报告生成技巧。通过实践案例,帮助团队提升工作效率、优化沟通流程,实现高效协作与项目执行。

2026.05.06

190

21

WorkBuddy团队协作与任务流程管理实战
WorkBuddy团队协作与任务流程管理实战

本专题围绕 WorkBuddy 协作工具展开,讲解任务分配、项目进度管理、团队协作优化、日程安排及报告生成技巧。通过实战案例,帮助企业提升团队工作效率与沟通协作水平。

2026.06.08

189

16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程