立即咨询

电话咨询

微信咨询

立即试用
商务合作

文心助手任务Agent登顶PinchBench:企业选任务型智能体要看什么

2026-07-24

 

 

给 AI 一个指令,它回了你三段漂亮的分析,结果要的文件没生成、要算的数算错了。这是头一回失望。换个任务,它又卡在"我不知道你说的文件在哪"。这是第二回。怕的是它说得头头是道,你复核发现关键结论根本站不住。这是第三回。

 

这类"动动嘴"却"迈不开腿"的尴尬,正是任务型智能体要解决的。七月十七号,百度文心助手任务 Agent 以九十四点六的峰值成绩、平均九十四点四登顶 PinchBench v2,在五十九个参评模型里拿下总榜头名。这件事对企业选型的启示,比榜单本身更值得拆。

 

PinchBench 登顶:考的不是"知不知道"而是"做没做完"

 

传统大模型基准像 MMLU、GPQA,考的是模型"知不知道"。PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,考的是另一件事:智能体能不能把整件事做完,并交付可验证的结果。

 

当前版本包含二十三个真实工作场景、一百四十七项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类,共完成六百一十七次测试运行。评分采用"自动化校验加 LLM 评审"双轨机制,全程零人工干预。

 

 

关键在"可验证"。传统基准看答案像不像对的,PinchBench 看交付物是不是真的存在、数值是不是真的算对。这把尺子,恰好量出了企业在乎的能力。

 

94.6% 背后的含义:同一底座,框架决定交付能力

 

文心助手任务 Agent 在五十九个参评模型里排在前列,领先 Claude Opus 4.8-fast 的九十三点五、通义千问 Qwen3.7-max 的九十二点五、Claude Opus 4.8 的九十点五、GPT-5.6-luna 的八十八点七。

 

更值得琢磨的是另一层:PinchBench 衡量的是模型与 Agent 框架的综合能力。同一底座模型,搭载不同 Agent 框架,末了得分差距会很大。也就是说,文心助手任务 Agent 拿头名,代表的是模型能力与系统工程协同的综合实力,不是单一模型参数的胜利。百度还在 GitHub 开源了完整评测流程,一百四十七个任务的执行快照、交付物和 LLM 评审理由全量公开,任何人都能逐条复现。

 

三个真实任务:任务型 Agent 把活干到了哪一步

 

看几个具体任务,比看分数更直观。

 

财务与安全的硬骨头先来。一个任务是:GitLab 2025 财年第三季度实际利润率与指引差了多少个基点?没给任何数据文件,Agent 要自主检索财报原文或电话会议记录,定位相关指引,算出非 GAAP 运营利润率约十八、超出指引约五百个基点,并把结论写进指定文件。五个自动化评分维度全部满分。

 

安全工程任务更硬:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。Agent 把 express RCE 和 JWT bypass 两个严重漏洞定为 P0,其中 JWT bypass 因有活跃利用记录特别标注;把 PostgreSQL SQL 注入定为次高级并结合支付路径给上下文;仅影响编译阶段的依赖漏洞降级处理;再排出五批次修复计划并附具体部署窗口。LLM 评审结论是所有维度表现卓越。

 

 

合同与日常的可验证交付同样扎实。读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要——这类活过去要律师助理花几个小时。文心助手任务 Agent 识别了客户方十二项风险、供应商十项风险、五项共享风险,以及付款六期分期的现金流前置问题和 IP 转让条件的产权间隙,四个维度全是满分。日常里,一份职业数据表让它统一表头、建汇总表、做 Top10 榜单并出图;一句"周末北京去青岛玩两天",它自主检索交通住宿景点排出完整行程。还能设定时任务,比如每周一晚汇总一周 AI 论文成投研风格 HTML。

 

为什么是百度做出来:二十年意图理解的复利

 

答案不复杂。百度是在意图理解上投入了二十多年的公司。文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架。

 

从架构逻辑看,搜索引擎本就是初代 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度跑了二十余年。工具集从索引爬虫升级成代码执行环境、文件处理器和实时 API,输出从蓝链列表变成结构化报告和可运行代码,底层逻辑一脉相承。模型任务评估提到九十四以上,证明好的系统架构与工程实现能显著释放模型潜力。对企业而言,任务型 Agent 不是又一个聊天框,而是一支能交付结果的数字员工,选它看的是每天帮你闭环了多少件事,而不是演示视频多炫。同一个底层模型,换上更优的 Agent 框架,任务完成率会更高。

 

目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,登录 chat.baidu.com 点选"任务"即可体验。百度把完整评测流程开源,也等于把"能不能复现"的主动权交还给行业,这一点对想认真评估的企业尤其重要。

 

企业选型建议:把"可验证交付"当成核心指标

 

Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。企业选任务型智能体,别只盯榜单和参数,要看它交付的是不是可验证的结果,是不是把多步任务真正拆完跑通,是不是愿意把执行过程公开可复现。

 

企业怎么把任务型 Agent 用起来。想认真评估,别只看榜单分数。头一步,挑一个真实的多步任务——比如周报汇总、合同初筛、报表对账——让候选 Agent 跑一遍,看它交付物是不是真存在、数值是不是真算对。第二步,要求厂商公开执行快照和评审理由,能复现才可信,像百度把一百四十七个任务的快照全量开源,就是可复现的范本。第三步,把"任务拆解加结果交付"当成选型硬指标,而不是比参数。任务型 Agent 的价值,不在于它"懂多少",在于它"办成了多少"。企业先把一个高重复、可核查的环节接管下来,跑通再扩展,比一口气铺开更稳。文心助手任务 Agent 这类产品的意义,是让 AI 从"动动嘴"走向"迈开腿",企业选它,盯住的应该是交付而不是榜单。先把周报汇总、合同初筛这类高重复环节交给它跑通,用真实交付物验证价值,再逐步扩展。榜单只是敲门砖,真正决定采购的,是它每天帮你省下的那几个小时。

 

 

如果你的团队在评估任务型智能体或百度智能体接入,可以联系云巴巴。云巴巴作为腾讯云AI智能体示范伙伴、腾讯WorkBuddy核心伙伴及官方授权服务中心,汇聚了百度文心等多家主流大模型与智能体厂商的产品和方案,能够结合你的业务任务形态、数据边界和验证要求,提供从选型对比、场景试点到实施对接的服务。欢迎咨询云巴巴,获取专属的智能体落地方案。

热门数字化产品

京东科技言犀数字人京东科技言犀数字人提供产品、服务、运营、营销场景的智能化方案。言犀虚拟主播电商应用场景及数据沉淀,保障品牌直播效果。言犀虚拟主播操作简单,功能强大,拥有业界一流智能化水平。库内通用形象丰富,且持续更新,可按需定制品牌专属数字人。
小望电商通小望电商通,全面数字化的电子发票(简称全电发票),是以可信身份认证体系和新型电子发票服务平台为依托,以标签化、要素化、去版式、授信制、赋码制为特征,以全领域、全环节、全要素电子化为运行模式的新型电子发票。
网易数帆有数BI有数BI是由网易数帆推出的一款企业级智能大数据敏捷分析平台。无需代码、PPT式简单拖拽即可轻松完成报告与大屏的制作。丰富的在线图表组件、可视化ETL操作、多终端智能预警等能力真正降低了用户的使用门槛,提高了数据使用效率,助力企业实现数据驱动决策。
北森盘点与发展系统北森盘点与发展系统,基于人才九宫格、人才名单结果,选拔高潜后备人才进入人才库,给予锻炼机会,加速成才。根据能力模型制定关键人才培养框架,根据盘点结果制定针对性的发展计划。评估角度多维度立体,适应企业现状,契合业务需要。
炎黄盈动AWS PaaS低代码平台炎黄盈动AWS PaaS低代码平台,PaaS是数字化转型的基石,支撑/探索不同发展级别的能力要求,以强大低代码能力 + 全场景BPM优势,引领国内PaaS市场发展。平台总体架构,成熟稳定、简单强大,轻,微应用,满足持续、大规模构建核心业务的苛刻要求。
为你推荐
Qoder 知识引擎上手难在哪:让 Agent 读懂大仓库比写代码更值钱

Qoder 知识引擎把一次性的项目搜索转成可复用、会进化的工程能力。本文拆解知识卡如何把工程语义变成 Agent 可消费的结构化上下文,并结合 SWE-bench Pro 实测,讲清它为何能提升任务得分、压低成本波动。

2026-07-24
自主迭代 Agent 怎么炼成?Qoder 用 ComputerUse 跑通自进化闭环

Qoder 用 ComputerUse 跑通自主迭代 Agent,靠 Goal 模式、自验证、回归守卫与项目记忆搭成自进化闭环,让不熟技术栈的人也能交付生产级软件,评测优于 Codex。

2026-07-24
AI 助手有意识吗?QoderWork 记忆反思成长让搭子会进化

QoderWork 上线意识功能,由记忆、反思、技能进化组成闭环,让 AI 助手跨会话记住偏好、主动忘记过时内容、把高频流程固化为本领,额外成本仅主对话百分之五。

2026-07-24
AI Coding 瓶颈从模型转移到人:Qoder 工程实践里的三层委派与睡后 Token

Qoder 的工程实践显示,当 AI 产出超过 Token 成本,瓶颈从模型转到人的精力。本文讲清三层委派、睡后 Token 与 Harness 平台,帮研发团队把人前移到决策位。

2026-07-24
夜间折扣怎么薅?Qoder 放夜里的 Credits 打到两折

Qoder 全系夜间折扣上线,每晚十点到早八点切 Qwen3.7 低至两折,模型能力不变。Desktop、CLI、QoderWork、QoderWake、Cloud Agents 各自适合夜间无人值守场景,把大任务放心交给夜里。

2026-07-24
查看更多