WorkBuddy Bench:腾讯优图开源的全场景AI工作智能体评测基准
一、WorkBuddy Bench 是什么
在AI智能体评测领域,一直缺少一个能真正衡量模型在真实职场中动手能力的标准。市面上常见的评测基准,要么是简单的代码填空题,要么是脱离实际工作流的理论问题。直到腾讯优图实验室和科恩安全实验室联合推出了
WorkBuddy Bench
简单来说,WorkBuddy Bench是一个
开源的真实岗位AI智能体评测基准框架
框架本身依托Docker沙箱隔离运行环境,自动化执行任务、校验产出,并输出标准化的打分结果。这从根本上解决了AI智能体实操能力缺乏统一、可信评测标准的行业痛点。更关键的是,所有数据集、执行代码和校验逻辑全部开源可复现,意味着任何人都可以验证和复现评测结果。数据集本体托管在Hugging Face,GitHub仓库则提供完整的评测运行调度框架。

二、功能特色
WorkBuddy Bench的设计思路非常清晰,它不是为了评测而评测,而是为了解决一个实际问题:如何客观、全面地评估AI智能体在真实职场中的表现?为此,它设计了一系列独特的功能。
首先是四大细分领域的完整评测数据集。
- Code开发子集(80题):主打Python仓库级工程任务,包括跨模块代码修复、功能迭代和单元测试编写。
- Web前端子集(70题):聚焦HTML/CSS/JS页面开发、可视化搭建和前端问题修复。
- Office办公子集(50题):涵盖Excel、CSV、PDF、Word等混合文档的数据清洗、统计和文档生成。
- Security安全子集(60题):涉及漏洞复现、恶意代码分析、红蓝攻防和安全运维排查。
其次是防数据污染的任务设计。
然后是Docker沙箱隔离运行。
双模式评测启动方案
通用大模型接口兼容性
最后,
标准化的自动打分与日志输出
results目录,方便后续的数据分析。三、技术细节
1. 仓库目录结构核心模块
为了让大家快速上手,这里梳理一下仓库的核心模块:
src/workbuddy_bench:框架的核心调度、打分和沙箱管理源码。datasets:数据集拉取脚本,数据集原始文件独立托管在Hugging Face。scripts:环境初始化、批量评测、数据集校验和任务预览脚本。configs:模型配置模板和评测任务Job模板。.agents/skills:AI智能体一键评测的自动化技能工具。.env.example:环境变量配置模板,用来存储模型API密钥和数据集路径。
2. 技术栈构成
WorkBuddy Bench的技术栈非常清晰和现代:
- 主开发语言是Python(占比92%),负责调度、打分和任务解析。
- 辅助脚本是Shell(7.5%),用于容器批量管理和环境一键安装。
- 环境定义采用Dockerfile(0.5%),构建标准化的沙箱镜像。
- 包管理工具使用uv,实现极速的Python依赖安装与版本锁定。
- 运行环境依赖Python≥3.12、Docker容器服务和Hugging Face的网络访问。
- 模型适配层采用标准化REST API,兼容所有遵循OpenAI协议的大模型服务。
3. 完整评测执行链路
整个评测流程高度自动化,大致分为7个步骤:
- 环境初始化:使用uv同步依赖,配置.env模型接口信息。
- 数据集拉取:脚本自动下载对应赛道的任务,并校验文件完整性。
- 任务沙箱初始化:为每个任务创建独立的Docker容器工作区。
- 调用目标AI智能体,下发职场任务。
- 沙箱执行智能体产出的文件/代码,运行校验用例。
- 自动计算得分,并记录完整的交互日志。
- 全部任务完成后,汇总分数并输出至结果文件夹。
四、应用场景
WorkBuddy Bench的应用场景非常广泛,几乎覆盖了所有与AI智能体能力评估相关的领域:
- 研发团队可以用它来量化自研代码智能体、通用工作智能体的真实职场实操能力,清晰地看到模型在开发、办公、安全等不同场景下的优劣。
大模型研发评测:
- 企业技术团队在做技术选型时,可以对比Claude Code、各类开源编码Agent、本地部署代码大模型的真实落地能力,为采购决策提供客观依据。
AI代码工具横向对比:
- 安全实验室可以测试AI智能体在漏洞挖掘、恶意代码分析方面的能力,评估AI辅助安全运维的落地效果。
AI安全攻防测试:
- 对于计算机、人工智能专业的研究人员来说,这是一个执行智能体自主规划、工具调用相关实验的标准化、可复现基准。
高校AI科研实验:
- 企业自研的办公AI、研发辅助AI在上线前,可以用它进行标准化验收,客观量化工具解决真实业务问题的能力。
企业内部AI工具验收:
五、使用方法
使用WorkBuddy Bench并不复杂,按照以下步骤操作即可。
1. 前置环境准备
首先,确保本地已安装Docker、Python 3.12及以上版本,以及uv包管理工具。然后克隆GitHub项目仓库到本地:
git clone https://github.com/Tencent/workbuddy-bench cd workbuddy-bench
2. 依赖与环境配置
- 执行
uv sync,自动安装所有Python依赖。 - 复制环境模板:
cp .env.example .env。 - 编辑.env文件,填入大模型的API地址、密钥、模型名称等参数。
3. 数据集下载
执行仓库内置的脚本,按需下载单个赛道或全部260道评测任务。脚本会自动校验文件哈希,防止数据集损坏。
4. 启动评测的两种模式
- 修改configs下的任务Job配置文件,指定评测赛道和目标模型,然后执行脚本启动正式评测。它还支持dry-run预览模式,可以先校验配置,而不运行完整任务。
手动自定义评测:
- 使用仓库内置的
一键自动化评测:
.agents/skills智能体技能,在支持Agent Skill的编码工具中调用指令,即可全自动完成数据集下载、模型配置、批量评测和分数汇总的全流程。
5. 结果查看
所有任务运行日志、单题得分、赛道平均分统一保存在项目results文件夹中,方便进行二次数据分析。
六、竞品对比
为了更直观地展示WorkBuddy Bench的优势,我们选取了2款主流的AI智能体评测基准进行多维度对比:
| 对比维度 | WorkBuddy Bench(腾讯) | HumanEval | AgentBench(Meta) |
|---|---|---|---|
| 开发主体 | 腾讯多实验室联合开源 | OpenAI | Meta FAIR团队 |
| 评测任务来源 | 企业真实业务工单逆向重构 | 简易独立代码填空题 | 人工构造多工具调用任务 |
| 覆盖赛道 | Code/前端Web/Office办公/安全Security 四大场景 | 仅Python代码单赛道 | 通用工具调用、网页交互,无安全、办公细分赛道 |
| 运行环境隔离 | Docker独立沙箱,任务环境完全隔离 | 本地直接运行代码,无隔离机制 | 轻量沙箱,不支持完整项目级工程测试 |
| 防刷分设计 | 真实业务定制任务,无公开网络原题 | 题目全网公开,大模型易记忆刷题 | 人工构造场景,存在公开数据集泄露风险 |
| 复现难度 | 完整容器镜像、数据集开源,一键复现 | 仅代码片段,无完整项目工程环境 | 依赖Meta自有环境组件,本地完整复现成本高 |
| 适配模型 | 所有OpenAI协议大模型,闭源/开源通用 | 仅适配代码专用大模型 | 仅适配Meta系模型,第三方模型适配复杂 |
七、常见问题解答
Q1:WorkBuddy Bench数据集可以单独下载使用吗?
A:当然可以。评测框架只提供调度逻辑,全部任务数据集托管在Hugging Face。仓库内置了专用下载脚本,可以单独拉取单赛道数据集,脱离框架单独使用。
Q2:本地没有Docker环境,能运行这个评测框架吗?
A:不能。所有任务校验和代码执行都依赖Docker沙箱隔离。缺少Docker会存在本地文件篡改、脚本恶意执行的风险,框架强制依赖容器环境。
Q3:我只需要评测前端Web智能体,需要下载全部260道任务吗?
A:不需要。下载脚本支持指定单赛道下载,只拉取70道Web前端任务即可,能节省本地存储和下载时间。
Q4:本地开源部署的大模型可以接入WorkBuddy Bench评测吗?
A:只要模型服务兼容OpenAI标准API接口,就可以直接接入。只需在.env文件填写本地模型接口地址和密钥,无需修改框架源码。
Q5:评测完成后的分数代表什么?不同赛道的分数可以对比吗?
A:单赛道分数仅代表智能体在该领域的实操能力。四大赛道的评分规则和任务难度是独立设计的,Code、Web、Office、Security的得分不能横向对比。
Q6:项目开源协议有什么限制?
A:项目采用腾讯自有开源协议,允许个人和企业非商用科研、测试使用。如果涉及到商用落地和二次分发,需要联系腾讯官方获取授权。
八、相关链接
- :https://github.com/Tencent/workbuddy-bench
GitHub仓库地址
- HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
- 技术论文:https://workbuddybench.com/report/main.pdf
- 项目官网:https://workbuddybench.com/
九、总结
WorkBuddy Bench作为腾讯推出的全场景职场AI智能体开源评测基准,其价值不仅在于填补了现有评测工具的空白,更在于它提供了一个真正贴近真实职场、可复现、可信赖的评测方案。它解决了传统评测只聚焦简易代码、缺少真实企业多岗位任务、没有安全与办公细分赛道的痛点。依托Docker沙箱,它实现了高可信度的自动化打分流程;通过兼容主流大模型服务,它降低了使用门槛;而双模式评测设计,则兼顾了轻量化与专业化的需求。
毫不夸张地说,无论你是大模型研发团队、企业AI工具选型者、安全攻防测试人员,还是高校人工智能科研人员,WorkBuddy Bench都能提供一个客观、标准化的智能体实操能力量化依据。这或许正是AI智能体评测领域,一直等待的那个“标准答案”。