
我的结论先放前面:模型升级应该由任务失败触发,别由排行榜触发。这句话是我最近一个月踩了各种坑之后才敢写下来的。下面讲讲我是怎么一步步走到这个结论的。

▲ 模型供给过剩之后,选型反而成了新问题
事情起点是腾讯发了 Hy4 preview。总参数 770B、激活 49B、上下文 1M+,主打通码、Office 和科研。同时 WorkBuddy / CodeBuddy 上 Hy4 限时免费两周,Hy3 免费延长到 9 月 30 日。搁以前我会先去查“Hy4 是不是最强”,这次没有,因为摆在我面前的问题早就变了:WorkBuddy 里 Kimi、GLM、Qwen、DeepSeek、混元、MiniMax、Seed 一字排开,每家还分 Max / Pro / Flash,高推理低推理。以前愁没模型用,现在愁不知道点哪个。
我过去选模型的逻辑很糙:新的比旧的好,大的比小的好,贵的比便宜的好。真正拿去干Coding、PPT、Workflow、Excel、查资料的活之后,我发现这套逻辑基本站不住。
Web Coding:27B 挤进了第一梯队附近
先说我用得最多的场景。Arena WebDev 到 8 月 21 日累计 603,789 次投票,开放模型里 Kimi K3 Max 第一,但排第三的是 Qwen3.8-27B,GLM-5.2 Max 第四,和 DeepSeek V4 Pro High 分数咬得很近。

▲ 27B 在特定任务里已经能贴近旗舰梯队(数据:Arena WebDev,2026-08-21)
所以我现在做 Web Coding 还在用 GLM-5.2。原因不是它新,是这活它现在依然干得好,我没理由换。Qwen3.8-27B 更有意思,27B 的体量照样在明确的 Web Coding 任务里打进了第一梯队附近。参数量描述的是模型本身,场景才决定这个模型对你值多少钱。2T、770B、27B 这些数字,回答不了“今天这活该叫谁”。
Workflow 和 Skill:真正让我开始降模型的场景
真正的转折点不是 Coding,是我在 Dify、Coze、ADP 上搭工作流的时候。典型的一条链:
读取数据 → 判断类型 → 调接口 → 写入结果 → 自动校验
搭好之后我发现,模型原来要做的“思考”已经被流程吃掉了。下一步干什么,流程写死了;模型往往只负责中间一个节点,判断输入属于 A、B 还是 C,判完后面还有程序兜底验证。这种节点我关心的只剩:准不准、快不快、结构化输出稳不稳、并发扛不扛得住、一次调用多少钱。要是还默认挂最大最贵的模型,就好比一道公式都列好的题,每次请一个专家组重新推导一遍。
所以这类任务我现在反着来:先上 Flash、Lite、低 reasoning 或者轻量模型试,够用就停,不够再升。
Skill 的感受更直接。一句“帮我把这事做完”,确实需要很聪明的模型,它得自己理解目标、拆任务、选工具、失败了重新规划。但如果方法已经沉淀成 Skill + Harness + 程序 + 校验规则,那部分“智能”其实已经从模型迁移到了工程系统里。SkillsBench 1.1(2026)的测试数据:人工整理的 Skills 把平均解决率从 33.9% 拉到 50.5%,涨了 16.6 个百分点。这对我刺激挺大,模型不是 AI 系统里唯一能买“智能”的货架。

▲ 工程化程度越高,模型要扛的不确定性越少
我现在把最终效果拆成:模型能力 + Skill + Harness + 工具 + 校验机制。这不是严格的数学公式,但比“换个更大的模型试试”更贴近我实际做 Agent 的体验。
PPT 和 Excel:按软件选模型也是坑
另一个典型误区是问“PPT 用哪个模型、Excel 用哪个模型”。我拿 PPT Master 做汇报举例子:模板现成、页面组件固定、视觉不归模型管,模型只需要理解资料、搭结构、写内容,然后把结构化结果交给程序。这种活我根本用不到旗舰模型那部分视觉能力,凭什么为它付费?
PPTAgent / PPTEval 的研究本来就把 PPT 拆成三个维度:Content 内容、Design 设计、Coherence 连贯性。只负责 Content 的话,视觉能力就不是核心指标。但如果任务是“看我的旧 PPT,识别图表、判断页面层级、重新设计”,那 Design 和视觉理解就回到了核心。正确的问法是:这次我让模型负责 PPT 的哪一部分。

▲ 同一个软件,对应的模型需求可能完全不同
Excel 同理。“帮我核对两张表”和“看完十几张业务表自己找出异常并解释原因”,都在 Excel 里,但一个是规则执行,一个是数据理解加业务判断加推理,两码事。
SpreadsheetBench 2 给的提醒更狠。它测的不是会不会写公式,是 321 个端到端真实业务任务,平均每个任务 11.8 个工作表、改约 593.5 个单元格。统一 Agent 框架下,最好的模型总体准确率只有 34.89%,Debug 任务只有 12%。大量失败出在很土的工程问题上:没充分检查工作簿、定位错单元格。所以在真实办公任务里,多加一次检查、加一个 Python 校验、上一个 verifier,经常比把模型再升一档管用。
Deep Research:我反而不省这份钱
看到这你可能以为我在劝大家全用便宜模型。不是。Deep Research 和开放性研究问题,我一点模型能力都不想省。
比如“研究未来三年寿险行业的 AI 转型会怎么变”。它跟核对 Excel 的区别不在字数,在于:路不清楚,模型得自己决定搜什么、先研究什么;任务链很长,搜索、阅读、判断、再搜索、处理矛盾信息、形成观点;最要命的是错了我也未必知道错了,没有哪个公式会弹一个 Research Failed 出来。这时候真正贵的成本是:一条错误事实混进推理链,最后产出一个看起来逻辑完整的错误结论。

▲ 旗舰模型处理不确定性,轻量模型消化确定性
旗舰模型值钱的地方,我现在的理解是处理不确定性,不是把简单任务做得更豪华。
我把选型压成了三个问题
绕了一圈,普通人不用背十几个模型的名字,我每次就问三个问题:
路清不清?任务已经有 Workflow、Skill、SOP 了,还是只有一个目标要模型自己想办法?
错了能不能验?代码能跑测试,Excel 能做规则校验,结构化数据能验证;行业判断、战略分析、研究结论很难自动判断对错。
它要自己干多久?“改一个按钮”和“理解整个代码库、自主修改、测试、失败恢复、继续干活”都叫 Coding,任务链越长,错误累积越狠。
压成一句人话:先看路清不清,再看错了能不能验,再看它要自己干多久。然后才问这次我最在乎什么:成本速度优先、均衡,还是效果优先。

▲ 10 秒选型决策树:先定能力档,再挑模型
按“能力预算”分区,比大小模型二分法好用
⚡ 执行区:消化确定性。Workflow、成熟 Skill、字段提取、固定格式 Excel、简单办公。不确定性已经被流程和程序提前吃掉了,该关心的是速度、稳定性、吞吐、成本。
⚖️ 工程区:理解、判断、有限规划。Web Coding、PPT 内容、多文件办公、复杂 Excel、普通资讯分析。目标大体明确但模型还得动脑,这是中型模型和 Flash 模型打得最凶的区域。
🚀 探索区:处理不确定性。Deep Research、长程 Coding Agent、复杂 Agent、战略分析、创新讨论。没有现成的路,答案也没法自动验证,你买的是模型找路径、持续推理、自我纠错的能力。

▲ 国产模型工作场景地图:当候选池用,别当排名用
落到具体名字上,我的候选池长这样
不排 Top 10,按方法给候选池。确定性强的任务(固定 Workflow、成熟 Skill、日常办公),GLM-5.3-Flash、DeepSeek V4 Flash、Qwen 的 Flash 系列,加上 Hy3 这种能力够用但成本低的,先进验证池。工程型场景(Web Coding、PPT 内容、多文件办公、普通分析),我更看 Qwen3.8-27B、MiniMax M3、DeepSeek V4 Pro 这种能力强但不必每次顶格的。Deep Research、复杂 Coding Agent、开放分析,Kimi K3、GLM-5.3 Max、Qwen3.8 Max、DeepSeek V4 高 reasoning 档才值得砸。
这张表保质期最多几个月。今天的旗舰半年后就是普通模型,长期管用的是前面那套判断方法。

▲ 8 条选型心法:先匹配能力,再选模型
回头看混元免费这件事
Hy4 不是小模型,770B 总参数、49B 激活、1M+ 上下文,定位就是 Coding、Office、科研生产力。它免费不代表它弱;它参数大也不代表所有活都该默认用它。免费是一种价格状态,不是能力等级。免费窗口真正值钱的地方,是把验证一个新模型的试错成本压到了足够低:拿真实 Coding 项目跑一次,拿真实 PPT 跑一次,把原来的 Workflow 切过去试一次,行就留着,不行就换。这比先采购一套最强模型再琢磨它能干什么健康多了。先验证,再投入。
Auto Router 能不能替我干这些?
理论上能。成熟的 Model Router 应该把这篇文章里的选择工作自动化,普通人不用记 Kimi 哪个版本最大、GLM 哪个是 Flash、DeepSeek 开 low 还是 high。理想产品就三个按钮:效率优先、均衡、效果优先,背后系统自己选。
但至少现在我还不会全交给黑盒 Router。倒不是我抓到了哪个 Router 的商业偏向,是用户通常不知道 Router 到底在优化什么:质量?成本?延迟?还是三者的某种组合?LLMRouterBench(ACL 2026)用 40 万+ 数据、21 个数据集、33 个模型、10 类 Router 做了统一比较,结论是模型间确实互补,但不少 Router(包括一些商业 Router)稳定跑不赢简单基线。所以今天人还不能完全退出模型选择。不过人要学的也不是背排行榜,是学会描述自己的任务。
最后
这篇文章的结论不是“多用混元”,不是“全用便宜模型”,也不是“旗舰没用”。我只想说一件事:不同的工作,本来就不该购买同样多的“智能”。被 Workflow、Skill、程序和规则写清楚的事,交给快、便宜、刚够用的模型去消化确定性;路径未知、错误难发现、要长时间探索的事,再把旗舰能力真正用起来。现在打开那一长串模型列表,我第一反应已经从“哪个最强”变成了“这件事到底需要多强”。
如果你正在为团队评估企业级 AI Agent 的选型与落地,可以直接找云巴巴聊聊。云巴巴是腾讯云 AI 智能体示范伙伴、腾讯 WorkBuddy 核心伙伴及官方授权服务中心,汇聚了 WorkBuddy、千问办公、TRAE Work 等多家主流 Agent 工具与方案,能结合你的数据边界、任务形态和团队能力,从选型对比、方案验证到陪跑落地提供一站式服务。欢迎咨询云巴巴,获取专属的 Agent 实施落地方案。


围绕跨境独立站访问慢的痛点,解析网宿科技全站加速WAS在海外节点布局、动静分离加速与智能调度上的能力,给出上线验证与运维建议。

围绕电商反爬与数据防抓取场景,拆解网宿BotGuard爬虫管理的识别机制与执行策略,给出评估维度、落地节奏与选型对比建议。

突发DDoS攻击如何应急?本文梳理攻击识别、流量牵引切换、业务降级保护、事后复盘与常态加固的完整处置流程,结合网宿DDoS云清洗的云端清洗机制,帮助企业把攻击造成的服务中断风险降到更低水平。

围绕网站动静分离这一加速基本功,解析网宿科技全站加速WAS在静态缓存、动态链路优化与统一调度上的能力,给出验证与持续调优建议。

面向金融业务场景,解析网宿网站安全监测在漏洞、内容、可用性三条线的监测能力,给出落地步骤、防护协同与合规选型建议。