
预算批下来了,只能签一家。技术负责人手里两个候选:刚发布的旗舰 Hy4 preview,和口碑已经跑出来的 GLM-5.3。翻遍公开资料,能找到的最硬对比只有腾讯那次盲测,2.99 对 2.92,差距 0.07 分。问同行,都说差不多;问厂商,都说自己好。可合同一签就是一年,"差不多"三个字没法写进采购依据。这篇不打算把 0.07 分放大成决定性优势,而是把这次盲测拆到能用的颗粒度,再给一套你自己就能跑的验证方法。
先看这组盲测的成色
用任何评测做决策依据之前,先要评估评测本身的可信度。Hy4 preview 和 GLM-5.3 对比,目前最硬的公开依据就是这组数据。
这组数据的来源是:163 名腾讯内部专家,对 203 个工程任务的结果做盲测打分,4 分制取均分。Hy4 preview 拿到 2.99,GLM-5.3 是 2.92,Kimi K3 是 2.94。
先说它可信的部分。评分是盲测,模型身份被屏蔽,专家不知道答案出自谁家,这屏蔽掉了品牌偏好。任务是真任务而不是榜单题,203 个工程任务模拟的是真实工作场景,比刷分更能反映实际表现。这些是这次评测比大多数营销数据扎实的地方。
再说它的边界。评测的组织方是腾讯,Hy4 preview 的出品方也是腾讯,利益相关这件事客观存在,倒不是说数据造假,而是任务集的选择、专家的构成,天然会向自己模型擅长的方向倾斜。任务面也窄,集中在工程类,你的业务如果不是写代码、做分析,这组数据的参考价值要打折扣。样本量同样有限,203 个任务能看出方向,撑不起精细的结论。

结论是:这组盲测可以作为"两者同量级、Hy4 略占上风"的依据,不足以作为"全面胜出"的依据。
40.4%才是关键数字
成色看清了,接下来拆这轮盲测数据分析里真正值钱的数字。均分差 0.07,媒体标题都写"略优"。但这次评测最有价值的数据不是均分,是胜负分布。
Hy4 preview 对 GLM-5.3 的单任务成绩是:胜 46.8%,平 12.8%,负 40.4%。
把这组数字翻译成采购语言:签了 Hy4 preview,在你们团队未来遇到的每 10 个任务里,大约有 5 个它做得比 GLM-5.3 好,1 个打平,剩下 4 个不如对手。
对 Kimi K3 的分布也值得看一眼:胜 51.2%,平 7.9%,负 40.9%。换了对手,落败率几乎纹丝不动。这个稳定性说明一个行业现状:头部模型之间不存在碾压,互有胜负是常态,任何"吊打"叙事都可以直接过滤掉。
对决策者来说,40.4% 这个数字带来的问题很具体:你无法知道自己的任务会落在胜的那 46.8%,还是负的那 40.4%。总分解决不了这个问题,因为你的任务集和评测的任务集是两个集合。

所以正确的读法是:这次盲测证明了两个模型都值得进入候选池,但没有证明该选哪个。真正的筛选,要靠你自己的数据。
最短路径自己测一轮
分布看清了,缺口要自己补。模型对比测试怎么做?没有想象中那么重,最精简的流程四步,两三天人力能跑完。
第一步,攒任务集。从团队近三个月真实做过的工作里挑 30 个任务,覆盖日常高频场景,故意放三五个公认难啃的。任务描述照平时给同事派活的写法写,不要精心润色,润色过的测试题测不出真实水平。
第二步,写死评分标准。推荐三档制:直接能用、小改能用、不能用。标准写在纸上,开跑之前全员过一遍。先看结果再定标准,是自测最常见的自欺方式。
第三步,跑盲评。两个模型做同样的任务,输出打乱顺序编号,让不知道来源的同事打分。有条件的话连响应耗时一起记录,后面用得上。
第四步,看分布。把 30 个任务按类型归类,标出每个任务谁胜谁负。这一步结束,你会得到比任何公开评测都值钱的结论,形如:合同审查类任务 A 稳定胜出,数据图表类任务 B 明显更好,代码类互有胜负。选型答案就藏在这种颗粒度里,企业 AI 模型采购走到这一步,才算真正有依据。
注意一个细节:如果你们业务里有一类任务占比特别高,比如八成工作都是同一种活,那测试就要向这类任务倾斜,30 个任务里放 15 个都不为过。自测的意义就是模拟你的真实分布,不是追求面面俱到。
决策先问任务分布
跑完自测,决策框架自然就浮出来了。在没跑之前,可以先按任务分布做方向判断,这也是大模型选型方法的核心一条:任务画像对不上,再高的总分都不作数。
任务如果集中在 Hy4 preview 明确发力的四个方向,软件工程、办公分析、游戏开发、科学研究,优先试它。它的训练数据和这些领域的专家共建,官方演示的案例也全落在这四块,任务画像对上的概率高。
任务如果是通用对话、内容创作、日常问答,这次盲测帮不上忙,它的任务集是工程任务,对这类场景没有区分度。这种情况下两个都可以进候选,靠自测分辨。
还有一笔账要提前算:Hy4 preview 当前有两个已知问题,复杂任务下的长思考和过度自我验证倾向,两者都会拉长响应时间、推高输出消耗,而它的输出单价是每百万 tokens 18 元。如果业务里有实时交互环节,这条可能比模型能力差异更能左右决策。自测时记录的耗时数据,在这一步正好派上用场。
最后一个现实提醒:Hy4 preview 是早期版本,官方已经说明后续还会显著迭代。如果采购周期是一年,版本演进带来的变化要写进合同考量;如果只是三个月的试点,现在入手踩点正合适。
云巴巴作为腾讯云AI智能体示范伙伴、腾讯WorkBuddy核心伙伴及官方授权服务中心。如果你还在几个同类产品之间犹豫,可以先到云巴巴把 Hy4 preview 和同类方案放在一起比一比——功能清单、适用规模、上手成本,一张表看明白。目前,Hy4 preview已经在云巴巴平台上线,想了解更多可以直接联系我们,选型路上少走弯路。


2026年9月22日由阿里云主办的2026云栖大会在杭州开幕,云巴巴作为阿里云MaaS生态伙伴受邀出席;9月23日云巴巴首席AI架构师倪江玮在【智启新程:AI驱动创新企业】分论坛发表《从账号到产能,千问办公落地真实场景的FDE实践》主题演讲,系统呈现云巴巴推动千问办公进入企业真实场景的FDE方法论与三阶段六模块交付体系。

报销解决员工垫付回款,结算解决合作方按成果取酬,两者解决的问题不同。本文对等说明两种路径的形态、报销路径适合的场景与范围、平台结算路径的适用条件、四处关键差异以及按条件做选择的判断方式。

责任划分的起点是关系性质。本文说明标准劳动关系、不完全劳动关系与民事合作关系的区分依据,用工责任与控制环节的对应关系,平台承担的审核与留存义务,人员自身应尽的信息真实性义务以及争议的处理路径。

对公划转、个人收款、托管账户与批量代付各有适用条件。本文对等说明四类通道的形态、对公收款的适用场景与前提、个人收款的限制与维护要点、通道选择要看的四类条件以及合规核对的三条线索。

批量发放出现退回是规模上去之后的常见情形。本文说明退回的三类直接原因、人员与账户的分层核对顺序、退回之后的处理顺序与时限安排、减少同类退回的四项前置动作以及台账应保留的字段。