腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

发布时间: 2026-07-24 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

评测套件污染这事儿,圈内人早就心照不宣。各家模型在某个 benchmark 上刷到天花板,真丢进生产环境照样翻车——因为你根本分不清那是推理能力的胜利,还是数据泄露的胜利。腾讯这次不打算继续玩这个游戏了。他们扔出来的 WorkBuddy Bench,一套横跨 Code、Web、Office、Security 四个领域的编码智能体评测套件,玩法很野:把所有任务从真实世界的 commit 记录、pull request 和业务事故里逆向工程回来,然后改写成一嘴口语化的角色扮演请求,逼着 Agent 在没背过题的情况下裸考。

垃圾评测养不出好 Agent

刷榜经济学早就该崩了

多数编码基准套件的寿命比想象中短得多。一旦公开,用不了几个月,训练数据里就会塞进形形色色的变体。HuggingFace 上随手一翻,满是“新 SOTA”的喜报,可真正让你在凌晨三点爬起来修线上事故的 Agent,跟那些榜单前几名往往是两码事。这不是模型不行,是测量工具失效了。WorkBuddy Bench 的核心思路简单粗暴:既然污染来源于公开文本,那就从非公开的真实工作流里刨出原材料,直接改写。不是改写 prompt,是改写整个任务的表达方式。

他们的任务来源是事故现场

团队没有坐在会议室里拍脑袋想题目。Code 领域的任务从真实的 commit 和 PR 记录中提取,也就是说,每一个需求背后都是一个曾经让工程师抓狂的具体问题。Web 和 Office 场景同样如此,直接取材于生产环境的业务脚本、报表生成、自动化办公流程。就连 Security 那块,也是从真实漏洞修复记录里逆向出来的。这些原始材料本身不像考题,更像一堆支离破碎的日志和工单。腾讯把它们重构成了一句话式的口语化请求,比如“帮我写个脚本把这个表里的异常价格标红”,而不是传统的“完成以下 Python pandas 操作”。这种表述转换,是过滤死记硬背的第一道筛子。

四组交叉火力,专治一专多能

Code 与 Security 互为照妖镜

编码 Agent 最常翻车的地方不是写不出代码,而是写出来的代码在安全上漏成筛子。WorkBuddy Bench 特意把这两个领域放进同一套模具里打量。一个任务可能表面上要你写一段处理用户上传文件的逻辑,背后埋着的坑却是路径穿越;另一个任务让你实现一个看似人畜无害的 Web 表单,却在输入校验里藏了 XSS。别指望只擅长刷 LeetCode 的模型能混过去——Security 模块要求的是防御性编程意识,而这恰恰是纯粹代码生成基准从来不测的东西。

Office 自动化才是真正的泥潭

很多人低估了办公场景的复杂度。写个 Python 脚本合并 Excel 表格,听起来像实习生练习题,可一旦涉及动态列名、格式保留、跨工作簿公式引用,以及某个人手误敲进去的合并单元格,模型就开始胡说八道。WorkBuddy Bench 的 Office 任务没有一个是干净整洁的“理想数据”。所有输入都沿袭了真实办公场景里的混乱特质——文件名不规范、日期格式混用、甚至数据中间夹杂着备注——你没法用意念清洗数据,只能硬桥硬马地处理。这种脏活累活,才是企业真正想交给 Agent 干的。

Web 任务的坑比想象中深

Web 领域的任务被拆解得尤其细致。不止是“写一个登陆页面”,而是嵌入在具体业务语境下的操作,比如根据 API 返回的状态动态渲染表格、在已有项目骨架里添加文件上传进度条,或者修复一个只在特定浏览器下复现的样式错乱。这些需求都被改写为了带情绪的口语——就像产品经理站在你工位旁边说的那句话:“哥们儿,这玩意儿咋在 Safari 上全塌了。”模型的指令跟随能力、跨文件上下文理解、以及面对模糊需求时的主动澄清,都会被逼出来。

开源到底开了些什么

连评测环境都给你原样复现

很多基准套件开源,其实是开源了一个 zip 包,里面塞满 JSON 和 txt,环境配置全靠猜。WorkBuddy Bench 的做法是连根拔起:每个任务都配有独立的目录结构、环境镜像和完整的自动化评分工具。你拉下来就能跑在 CodeBuddy Code 或 Claude Code 上,不需要自己去猜依赖版本。评分逻辑也完全透明——不是黑盒的“相似度打分”,而是基于结果正确性、副作用检测、安全漏洞扫描等多维判定。这意味着任何团队都能把它插进自己的 CI 里,当作真正的质量关卡来用。

用角色扮演对抗数据污染

把每一个任务改写为口语化角色扮演请求,这招比看起来狠多了。传统的 prompt 模板容易在训练数据里被反向匹配,因为格式稳定、关键词密集。而口语化请求充满了省略、指代不明、情绪化表达甚至前后矛盾。一个典型例子:“我老板疯了,非要在每天下午五点自动把昨天的销售数据画成图塞他邮箱里,你帮我搞定。”这种话术,目前的训练集很难系统性地覆盖。腾讯正是用这类非结构化的表达,来检验 Agent 的意图理解和规划能力,而不是又一轮记忆力的较量。

你以为在做基准,其实是在定义工作流

Agent 评估的终局不是刷分

WorkBuddy Bench 对整个行业最大的暗示,藏在它覆盖的四个领域组合里。Code、Web、Office、Security——这不是随机拼凑,而是构成一个知识工作者日常任务流的缩影。腾讯显然没打算做一个学术打分器,他们要的是一个在企业内部真正能卡住 Agent 质量的标准。开源这个动作,等于把定义工作流的话语权摊在桌上:以后你要证明自己的 Agent 能干活,就先过我这一关。而且我告诉你,题目我都没背过,因为每个任务都是从真实烂摊子里刨出来的。

留给闭源套件的窗口正在关闭

当一个基准把环境镜像、评分工具、参考方案全部开源,它的迭代速度就不再依赖单一团队。社区可以往里贡献更多从事故现场提取的任务,也可以把评分维度打磨得更毒辣。闭源、人工评分的昂贵评测模式,在工程落地层面会越来越难以自洽。WorkBuddy Bench 也许不会马上终结刷榜时代,但它至少画了一条清醒的分界线:真正可靠的编码 Agent,得在没洗过澡的数据里把活干利索。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 46

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
下一篇: 没有了
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线