首页 > 教程攻略 > ai资讯 >WorkBuddy Bench - 腾讯开源的编码智能体评测套件

WorkBuddy Bench - 腾讯开源的编码智能体评测套件

来源:互联网 时间:2026-07-25 14:39:13

WorkBuddy Bench是什么

腾讯最近开源了一个叫 WorkBuddy Bench 的编码智能体评测套件,覆盖代码、网页、办公、安全四个真实场景,每一类任务都是从真实的 commit、PR 以及业务场景逆向构建出来的。怎么构建的呢?先把真实需求改写成口语化的请求,这样搜索引擎搜不到原题,从源头上防止数据污染。全部 260 个任务在隔离沙箱里跑,通过隐藏测试、规则检查加上 LLM 评判多元评分,再在双框架下交叉验证,最终实现开源可复现、可审计的端到端评测。

WorkBuddy Bench的主要功能

  • Code(代码)

    :80 个仓库级软件工程任务,涵盖 bug 修复、功能开发、接口调整、算法实现等 18 个类别,由开发者、算法工程师、产品经理、QA、运维五种角色发起请求。
  • Web(网页)

    :70 个前端任务,覆盖页面实现、交互设计、数据可视化、视觉设计、代码测试、文档转换等 7 个类别,要求交付可运行的前端制品而非对话文本。
  • Office(办公)

    :50 个多文件业务流程任务,智能体需处理电子表格、文档、PDF、JSON 等混合格式文件,完成数据核对、报告生成、状态更新等交接型工作。
  • Security(安全)

    :60 个红蓝队安全任务,包括漏洞发现与利用、恶意软件分析、安全运营、AI 智能体安全评估,采用确定性评分脚本,无 LLM 评判器参与。

WorkBuddy Bench的技术原理

  • 逆向工程构建

    :每个任务从真实代码提交、PR、CVE 或业务场景逆向工程而来,改写为简短口语化的角色扮演请求,使提示词无法通过搜索引擎还原。
  • 刻意信息不充分

    :请求仅陈述意图与约束,省略目标文件、精确接口、边界处理等细节,智能体必须自行从工作区恢复上下文,测试需求消歧与落地能力。
  • 回合后评估隔离

    :智能体解题期间能看到任务指令与工作区,评分资产(隐藏测试、评分细则等)在完成后才引入沙箱,避免评分信息泄露。
  • 双框架交叉验证

    :所有任务在 CodeBuddy Code 与 Claude Code 两种智能体框架下分别运行,消除单一框架的系统性偏差。
  • 抗污染机制

    :依赖任务构建方式封闭可搜索提示路径,配合数据集版本管理定期刷新,替代传统保密式防污染方案。

如何使用WorkBuddy Bench

  • 获取任务集

    :访问 GitHub 下载标准化任务目录,包含 instruction.md、task.toml、environment/ 环境镜像与 tests/ 评分资产。
  • 运行评测

    :将智能体接入 Harbor 风格任务目录,在隔离 Docker 沙箱中执行,智能体读取自然语言请求后探索工作区并生成制品。
  • 查看结果

    :任务完成后自动运行评分器,代码子集通过隐藏单元测试评分,网页子集通过规则+LLM/VLM+智能体评判器评分,办公子集通过规则检查与证据驱动的 LLM 评判器评分,安全子集通过确定性 scoring.py 评分。
  • 独立审计

    :任何第三方均可离线重新运行单个任务并直接检查其内容,实现端到端可复现与可审计。

WorkBuddy Bench的核心优势

  • 真实工作分布

    :任务类别、模式、难度均匹配内部真实使用分类法,非基于公开题库或教程练习构造。
  • 完全开源可审计

    :任务目录、环境镜像、评估代码、评分测试、参考答案全部公开,区别于 CursorBench 等封闭厂商基准。
  • 多维度评分体系

    :代码用隐藏测试、网页用规则+语义+交互三重评判、办公用规则+证据驱动 LLM 评判、安全用确定性脚本,各子集评分工具独立设计。
  • 角色与场景多样性

    :代码子集引入五种请求者角色,安全子集覆盖红蓝队全频谱,避免单一任务类型导致的评估偏差。
  • 效率与能力解耦

    :排行榜同时报告 token 消耗与轮次效率,GPT-5.5 以最小输出预算取得顶级分数,证明高分不等于高消耗。

WorkBuddy Bench的项目地址

  • 项目官网

    :https://workbuddybench.com/
  • GitHub仓库

    :https://github.com/Tencent/workbuddy-bench
  • HuggingFace模型库

    :https://huggingface.co/datasets/tencent/workbuddy-bench
  • 技术论文

    :https://workbuddybench.com/report/main.pdf

WorkBuddy Bench的同类竞品对比

维度WorkBuddy BenchSWE-bench 任务来源:真实 commit/PR/业务场景逆向工程 vs 公开 GitHub issue
抗污染方式:构建层面封闭搜索路径+版本管理 vs 依赖发布时的新颖性
覆盖领域:Code / Web / Office / Security 四领域 vs 仅代码缺陷修复
开源程度:任务/镜像/评分/答案全部公开 vs 公开任务集与测试
请求风格:口语化、角色扮演、信息不充分 vs 详细技术 issue 描述
评测框架:双框架(CodeBuddy + Claude Code) vs 单一框架

WorkBuddy Bench的应用场景

  • 智能体研发基准

    :为编码智能体、前端 AI 工具、办公自动化 Agent、安全 AI 提供标准化能力标尺。
  • 模型选型参考

    :跨模型排行榜覆盖 Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4 等主流模型,辅助企业选型。
  • 学术研究与对比

    :完全开源的任务集与评分协议,支持第三方复现、审计与改进,推动领域基准迭代。
  • 产品迭代优化

    :通过细分的子集得分与 token 效率数据,定位智能体在代码导航、前端状态管理、跨文件一致性等具体环节的短板。
  • 安全能力评估

    :独立的安全子集为 AI 红队与蓝队能力提供可量化的攻防测试环境。