首页 > 教程攻略 > ai资讯 >WorkBuddy Bench:腾讯优图开源的全场景AI工作智能体评测基准

WorkBuddy Bench:腾讯优图开源的全场景AI工作智能体评测基准

来源:互联网 时间:2026-07-26 12:29:07

一、WorkBuddy Bench 是什么

在AI智能体评测领域,一直缺少一个能真正衡量模型在真实职场中动手能力的标准。市面上常见的评测基准,要么是简单的代码填空题,要么是脱离实际工作流的理论问题。直到腾讯优图实验室和科恩安全实验室联合推出了

WorkBuddy Bench

,这个局面才得以改变。

简单来说,WorkBuddy Bench是一个

开源的真实岗位AI智能体评测基准框架

。它的核心使命,就是量化评估各类代码、通用工作型AI智能体在实际工作中的综合实操能力。你猜怎么着?它所有的任务都源自腾讯内部的真实业务需求、线上缺陷和研发工单逆向重构,而不是那些在网络上随处可见的、能靠记忆刷分的“标准题”。

框架本身依托Docker沙箱隔离运行环境,自动化执行任务、校验产出,并输出标准化的打分结果。这从根本上解决了AI智能体实操能力缺乏统一、可信评测标准的行业痛点。更关键的是,所有数据集、执行代码和校验逻辑全部开源可复现,意味着任何人都可以验证和复现评测结果。数据集本体托管在Hugging Face,GitHub仓库则提供完整的评测运行调度框架。

WorkBuddy Bench(图1)

二、功能特色

WorkBuddy Bench的设计思路非常清晰,它不是为了评测而评测,而是为了解决一个实际问题:如何客观、全面地评估AI智能体在真实职场中的表现?为此,它设计了一系列独特的功能。

首先是四大细分领域的完整评测数据集。

整个框架总计包含260道真实业务任务,并贴心地划分成Code、Web、Office、Security四个独立评测子集。每个赛道的评分体系都是独立的,互不干扰,这能精准地定位出智能体在哪方面有短板。具体来看:

  • Code开发子集(80题):主打Python仓库级工程任务,包括跨模块代码修复、功能迭代和单元测试编写。
  • Web前端子集(70题):聚焦HTML/CSS/JS页面开发、可视化搭建和前端问题修复。
  • Office办公子集(50题):涵盖Excel、CSV、PDF、Word等混合文档的数据清洗、统计和文档生成。
  • Security安全子集(60题):涉及漏洞复现、恶意代码分析、红蓝攻防和安全运维排查。

其次是防数据污染的任务设计。

这一点非常重要。很多评测基准因为题目公开,大模型很容易靠训练记忆“背题刷分”,导致分数失真。WorkBuddy Bench的所有任务都基于内部真实工单重构改写,没有公开网络原题,评测分数能真实反映智能体的实际动手能力,而不是记忆力。

然后是Docker沙箱隔离运行。

每一项评测任务都在独立的容器环境中运行,文件修改、代码执行、脚本运行完全隔离。这既保护了本地环境不被污染,也保证了所有评测流程的100%可复现性。

双模式评测启动方案

也照顾到了不同用户的需求。它提供手动配置的完整评测流程,以及Agent技能一键全自动评测两种模式,既能满足专业算法研究员对精细控制的需求,也能让轻量化快速测试的用户快速上手。

通用大模型接口兼容性

做得很好。它统一适配了OpenAI标准接口协议,无论是主流的闭源大模型,还是开源的本地大模型,都可以通过环境变量配置API密钥和接口地址接入,几乎没有额外的改造成本。

最后,

标准化的自动打分与日志输出

让结果分析变得简单。内置的自动化校验套件能自动验证代码运行结果、文件输出和安全报告完整性,评测日志和分数明细统一归档至results目录,方便后续的数据分析。

三、技术细节

1. 仓库目录结构核心模块

为了让大家快速上手,这里梳理一下仓库的核心模块:

  • src/workbuddy_bench:框架的核心调度、打分和沙箱管理源码。
  • datasets:数据集拉取脚本,数据集原始文件独立托管在Hugging Face。
  • scripts:环境初始化、批量评测、数据集校验和任务预览脚本。
  • configs:模型配置模板和评测任务Job模板。
  • .agents/skills:AI智能体一键评测的自动化技能工具。
  • .env.example:环境变量配置模板,用来存储模型API密钥和数据集路径。

2. 技术栈构成

WorkBuddy Bench的技术栈非常清晰和现代:

  • 主开发语言是Python(占比92%),负责调度、打分和任务解析。
  • 辅助脚本是Shell(7.5%),用于容器批量管理和环境一键安装。
  • 环境定义采用Dockerfile(0.5%),构建标准化的沙箱镜像。
  • 包管理工具使用uv,实现极速的Python依赖安装与版本锁定。
  • 运行环境依赖Python≥3.12、Docker容器服务和Hugging Face的网络访问。
  • 模型适配层采用标准化REST API,兼容所有遵循OpenAI协议的大模型服务。

3. 完整评测执行链路

整个评测流程高度自动化,大致分为7个步骤:

  1. 环境初始化:使用uv同步依赖,配置.env模型接口信息。
  2. 数据集拉取:脚本自动下载对应赛道的任务,并校验文件完整性。
  3. 任务沙箱初始化:为每个任务创建独立的Docker容器工作区。
  4. 调用目标AI智能体,下发职场任务。
  5. 沙箱执行智能体产出的文件/代码,运行校验用例。
  6. 自动计算得分,并记录完整的交互日志。
  7. 全部任务完成后,汇总分数并输出至结果文件夹。

四、应用场景

WorkBuddy Bench的应用场景非常广泛,几乎覆盖了所有与AI智能体能力评估相关的领域:

  1. 大模型研发评测:

    研发团队可以用它来量化自研代码智能体、通用工作智能体的真实职场实操能力,清晰地看到模型在开发、办公、安全等不同场景下的优劣。
  2. AI代码工具横向对比:

    企业技术团队在做技术选型时,可以对比Claude Code、各类开源编码Agent、本地部署代码大模型的真实落地能力,为采购决策提供客观依据。
  3. AI安全攻防测试:

    安全实验室可以测试AI智能体在漏洞挖掘、恶意代码分析方面的能力,评估AI辅助安全运维的落地效果。
  4. 高校AI科研实验:

    对于计算机、人工智能专业的研究人员来说,这是一个执行智能体自主规划、工具调用相关实验的标准化、可复现基准。
  5. 企业内部AI工具验收:

    企业自研的办公AI、研发辅助AI在上线前,可以用它进行标准化验收,客观量化工具解决真实业务问题的能力。

五、使用方法

使用WorkBuddy Bench并不复杂,按照以下步骤操作即可。

1. 前置环境准备

首先,确保本地已安装Docker、Python 3.12及以上版本,以及uv包管理工具。然后克隆GitHub项目仓库到本地:

git clone https://github.com/Tencent/workbuddy-bench
cd workbuddy-bench

2. 依赖与环境配置

  1. 执行uv sync,自动安装所有Python依赖。
  2. 复制环境模板:cp .env.example .env
  3. 编辑.env文件,填入大模型的API地址、密钥、模型名称等参数。

3. 数据集下载

执行仓库内置的脚本,按需下载单个赛道或全部260道评测任务。脚本会自动校验文件哈希,防止数据集损坏。

4. 启动评测的两种模式

  1. 手动自定义评测:

    修改configs下的任务Job配置文件,指定评测赛道和目标模型,然后执行脚本启动正式评测。它还支持dry-run预览模式,可以先校验配置,而不运行完整任务。
  2. 一键自动化评测:

    使用仓库内置的.agents/skills智能体技能,在支持Agent Skill的编码工具中调用指令,即可全自动完成数据集下载、模型配置、批量评测和分数汇总的全流程。

5. 结果查看

所有任务运行日志、单题得分、赛道平均分统一保存在项目results文件夹中,方便进行二次数据分析。

六、竞品对比

为了更直观地展示WorkBuddy Bench的优势,我们选取了2款主流的AI智能体评测基准进行多维度对比:

对比维度WorkBuddy Bench(腾讯)HumanEvalAgentBench(Meta)
开发主体腾讯多实验室联合开源OpenAIMeta FAIR团队
评测任务来源企业真实业务工单逆向重构简易独立代码填空题人工构造多工具调用任务
覆盖赛道Code/前端Web/Office办公/安全Security 四大场景仅Python代码单赛道通用工具调用、网页交互,无安全、办公细分赛道
运行环境隔离Docker独立沙箱,任务环境完全隔离本地直接运行代码,无隔离机制轻量沙箱,不支持完整项目级工程测试
防刷分设计真实业务定制任务,无公开网络原题题目全网公开,大模型易记忆刷题人工构造场景,存在公开数据集泄露风险
复现难度完整容器镜像、数据集开源,一键复现仅代码片段,无完整项目工程环境依赖Meta自有环境组件,本地完整复现成本高
适配模型所有OpenAI协议大模型,闭源/开源通用仅适配代码专用大模型仅适配Meta系模型,第三方模型适配复杂

七、常见问题解答

Q1:WorkBuddy Bench数据集可以单独下载使用吗?

A:当然可以。评测框架只提供调度逻辑,全部任务数据集托管在Hugging Face。仓库内置了专用下载脚本,可以单独拉取单赛道数据集,脱离框架单独使用。

Q2:本地没有Docker环境,能运行这个评测框架吗?

A:不能。所有任务校验和代码执行都依赖Docker沙箱隔离。缺少Docker会存在本地文件篡改、脚本恶意执行的风险,框架强制依赖容器环境。

Q3:我只需要评测前端Web智能体,需要下载全部260道任务吗?

A:不需要。下载脚本支持指定单赛道下载,只拉取70道Web前端任务即可,能节省本地存储和下载时间。

Q4:本地开源部署的大模型可以接入WorkBuddy Bench评测吗?

A:只要模型服务兼容OpenAI标准API接口,就可以直接接入。只需在.env文件填写本地模型接口地址和密钥,无需修改框架源码。

Q5:评测完成后的分数代表什么?不同赛道的分数可以对比吗?

A:单赛道分数仅代表智能体在该领域的实操能力。四大赛道的评分规则和任务难度是独立设计的,Code、Web、Office、Security的得分不能横向对比。

Q6:项目开源协议有什么限制?

A:项目采用腾讯自有开源协议,允许个人和企业非商用科研、测试使用。如果涉及到商用落地和二次分发,需要联系腾讯官方获取授权。

八、相关链接

  1. GitHub仓库地址

    :https://github.com/Tencent/workbuddy-bench
  2. HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
  3. 技术论文:https://workbuddybench.com/report/main.pdf
  4. 项目官网:https://workbuddybench.com/

九、总结

WorkBuddy Bench作为腾讯推出的全场景职场AI智能体开源评测基准,其价值不仅在于填补了现有评测工具的空白,更在于它提供了一个真正贴近真实职场、可复现、可信赖的评测方案。它解决了传统评测只聚焦简易代码、缺少真实企业多岗位任务、没有安全与办公细分赛道的痛点。依托Docker沙箱,它实现了高可信度的自动化打分流程;通过兼容主流大模型服务,它降低了使用门槛;而双模式评测设计,则兼顾了轻量化与专业化的需求。

毫不夸张地说,无论你是大模型研发团队、企业AI工具选型者、安全攻防测试人员,还是高校人工智能科研人员,WorkBuddy Bench都能提供一个客观、标准化的智能体实操能力量化依据。这或许正是AI智能体评测领域,一直等待的那个“标准答案”。