
给 AI 一个指令,它回了你三段漂亮的分析,结果要的文件没生成、要算的数算错了。这是头一回失望。换个任务,它又卡在"我不知道你说的文件在哪"。这是第二回。怕的是它说得头头是道,你复核发现关键结论根本站不住。这是第三回。
这类"动动嘴"却"迈不开腿"的尴尬,正是任务型智能体要解决的。七月十七号,百度文心助手任务 Agent 以九十四点六的峰值成绩、平均九十四点四登顶 PinchBench v2,在五十九个参评模型里拿下总榜头名。这件事对企业选型的启示,比榜单本身更值得拆。
PinchBench 登顶:考的不是"知不知道"而是"做没做完"
传统大模型基准像 MMLU、GPQA,考的是模型"知不知道"。PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,考的是另一件事:智能体能不能把整件事做完,并交付可验证的结果。
当前版本包含二十三个真实工作场景、一百四十七项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类,共完成六百一十七次测试运行。评分采用"自动化校验加 LLM 评审"双轨机制,全程零人工干预。

关键在"可验证"。传统基准看答案像不像对的,PinchBench 看交付物是不是真的存在、数值是不是真的算对。这把尺子,恰好量出了企业在乎的能力。
94.6% 背后的含义:同一底座,框架决定交付能力
文心助手任务 Agent 在五十九个参评模型里排在前列,领先 Claude Opus 4.8-fast 的九十三点五、通义千问 Qwen3.7-max 的九十二点五、Claude Opus 4.8 的九十点五、GPT-5.6-luna 的八十八点七。
更值得琢磨的是另一层:PinchBench 衡量的是模型与 Agent 框架的综合能力。同一底座模型,搭载不同 Agent 框架,末了得分差距会很大。也就是说,文心助手任务 Agent 拿头名,代表的是模型能力与系统工程协同的综合实力,不是单一模型参数的胜利。百度还在 GitHub 开源了完整评测流程,一百四十七个任务的执行快照、交付物和 LLM 评审理由全量公开,任何人都能逐条复现。
三个真实任务:任务型 Agent 把活干到了哪一步
看几个具体任务,比看分数更直观。
财务与安全的硬骨头先来。一个任务是:GitLab 2025 财年第三季度实际利润率与指引差了多少个基点?没给任何数据文件,Agent 要自主检索财报原文或电话会议记录,定位相关指引,算出非 GAAP 运营利润率约十八、超出指引约五百个基点,并把结论写进指定文件。五个自动化评分维度全部满分。
安全工程任务更硬:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。Agent 把 express RCE 和 JWT bypass 两个严重漏洞定为 P0,其中 JWT bypass 因有活跃利用记录特别标注;把 PostgreSQL SQL 注入定为次高级并结合支付路径给上下文;仅影响编译阶段的依赖漏洞降级处理;再排出五批次修复计划并附具体部署窗口。LLM 评审结论是所有维度表现卓越。

合同与日常的可验证交付同样扎实。读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要——这类活过去要律师助理花几个小时。文心助手任务 Agent 识别了客户方十二项风险、供应商十项风险、五项共享风险,以及付款六期分期的现金流前置问题和 IP 转让条件的产权间隙,四个维度全是满分。日常里,一份职业数据表让它统一表头、建汇总表、做 Top10 榜单并出图;一句"周末北京去青岛玩两天",它自主检索交通住宿景点排出完整行程。还能设定时任务,比如每周一晚汇总一周 AI 论文成投研风格 HTML。
为什么是百度做出来:二十年意图理解的复利
答案不复杂。百度是在意图理解上投入了二十多年的公司。文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架。
从架构逻辑看,搜索引擎本就是初代 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度跑了二十余年。工具集从索引爬虫升级成代码执行环境、文件处理器和实时 API,输出从蓝链列表变成结构化报告和可运行代码,底层逻辑一脉相承。模型任务评估提到九十四以上,证明好的系统架构与工程实现能显著释放模型潜力。对企业而言,任务型 Agent 不是又一个聊天框,而是一支能交付结果的数字员工,选它看的是每天帮你闭环了多少件事,而不是演示视频多炫。同一个底层模型,换上更优的 Agent 框架,任务完成率会更高。
目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,登录 chat.baidu.com 点选"任务"即可体验。百度把完整评测流程开源,也等于把"能不能复现"的主动权交还给行业,这一点对想认真评估的企业尤其重要。
企业选型建议:把"可验证交付"当成核心指标
Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。企业选任务型智能体,别只盯榜单和参数,要看它交付的是不是可验证的结果,是不是把多步任务真正拆完跑通,是不是愿意把执行过程公开可复现。
企业怎么把任务型 Agent 用起来。想认真评估,别只看榜单分数。头一步,挑一个真实的多步任务——比如周报汇总、合同初筛、报表对账——让候选 Agent 跑一遍,看它交付物是不是真存在、数值是不是真算对。第二步,要求厂商公开执行快照和评审理由,能复现才可信,像百度把一百四十七个任务的快照全量开源,就是可复现的范本。第三步,把"任务拆解加结果交付"当成选型硬指标,而不是比参数。任务型 Agent 的价值,不在于它"懂多少",在于它"办成了多少"。企业先把一个高重复、可核查的环节接管下来,跑通再扩展,比一口气铺开更稳。文心助手任务 Agent 这类产品的意义,是让 AI 从"动动嘴"走向"迈开腿",企业选它,盯住的应该是交付而不是榜单。先把周报汇总、合同初筛这类高重复环节交给它跑通,用真实交付物验证价值,再逐步扩展。榜单只是敲门砖,真正决定采购的,是它每天帮你省下的那几个小时。

如果你的团队在评估任务型智能体或百度智能体接入,可以联系云巴巴。云巴巴作为腾讯云AI智能体示范伙伴、腾讯WorkBuddy核心伙伴及官方授权服务中心,汇聚了百度文心等多家主流大模型与智能体厂商的产品和方案,能够结合你的业务任务形态、数据边界和验证要求,提供从选型对比、场景试点到实施对接的服务。欢迎咨询云巴巴,获取专属的智能体落地方案。


Qoder 知识引擎把一次性的项目搜索转成可复用、会进化的工程能力。本文拆解知识卡如何把工程语义变成 Agent 可消费的结构化上下文,并结合 SWE-bench Pro 实测,讲清它为何能提升任务得分、压低成本波动。

Qoder 用 ComputerUse 跑通自主迭代 Agent,靠 Goal 模式、自验证、回归守卫与项目记忆搭成自进化闭环,让不熟技术栈的人也能交付生产级软件,评测优于 Codex。

QoderWork 上线意识功能,由记忆、反思、技能进化组成闭环,让 AI 助手跨会话记住偏好、主动忘记过时内容、把高频流程固化为本领,额外成本仅主对话百分之五。

Qoder 的工程实践显示,当 AI 产出超过 Token 成本,瓶颈从模型转到人的精力。本文讲清三层委派、睡后 Token 与 Harness 平台,帮研发团队把人前移到决策位。

Qoder 全系夜间折扣上线,每晚十点到早八点切 Qwen3.7 低至两折,模型能力不变。Desktop、CLI、QoderWork、QoderWake、Cloud Agents 各自适合夜间无人值守场景,把大任务放心交给夜里。