
# AA-Briefcase榜单:Kimi K3力压GPT-5.6排第二,20个模型比真实干活
Artificial Analysis数据日期:2026-07-19
一句话:AA-Briefcase测的是模型"干活"的真本事
AA-Briefcase是Artificial Analysis发布的知识工作Agent能力排行榜,专门测大模型在多周复杂项目里的真实工作能力,不是考试不是问答,而是让模型像正式员工一样在模拟真实商业环境里独立完成项目交付。
和传统排行榜(如Intelligence Index)的本质区别
Intelligence Index测智商,单轮推理和标准化考试,考数学编程推理,一次性答题,看答对题数,意义是模型聪不聪明;AA-Briefcase测工作能力,多周项目和真实交付物,考财务报表、产品策略、数据分析、董事会汇报,连续数周处理2000+文件、3500+邮件、25000+ Slack消息,用客观rubric对错加分析质量加呈现质量的综合Elo评分,意义是模型能不能拿来干活。
为什么AA-Briefcase值得关注
过去两年大模型智商一路飙升,Intelligence Index上50分早被多家突破,但智商高的模型交付物质量也一定好吗?AA-Briefcase正是为回答这个。它设计了4个多周项目模拟真实商业场景:数据科学做数据分析,交付数据清洗报告、预测模型、可视化图表;产品管理做产品策略,交付竞品分析、roadmap建议、PRD;银行运营做金融建模,交付财务报表、风险评估、投资分析;重工业战略做企业战略,交付市场进入方案、董事会汇报PPT。每个场景持续数周,每周多任务,模型要读大量文件提取隐含需求、用对证据、产出专业交付物。
最终评分由三维度组成:客观Rubric(对/错)看任务是否达明确标准;分析质量Elo两两对比谁的交付更深刻有洞察;呈现质量Elo两两对比谁的交付更专业适合展示。三维综合成最终Elo,1500+顶级,800以下不合格。
完整排行榜(20个模型参评)
本次共20个模型参评,涵盖Claude、GPT、Kimi、GLM、DeepSeek、Grok、Gemini等全序列。前几名:Claude Fable 5(with fallback)1583(1568-1599)居首;Kimi K3 1545(1533-1558)第二;GPT-5.6 Sol(max)1496(1484-1508)第三;Claude Sonnet 5(max)1388第四;Claude Opus 4.8(max)1354第五;Grok 4.5(high)1323第六;GLM-5.2(max)1260第七;GPT-5.5(xhigh)1154第八;MiniMax-M3 1110第九;DeepSeek V4 Pro(max)932第十;其后Qwen3.7 Max 908、MiMo-V2.5-Pro 873、Nemotron 3 Ultra 870、Gemini 3.5 Flash 866、Muse Spark 1.1(xhigh)863、Inkling 836、DeepSeek V4 Flash(max)831、Kimi K2.6 816、Claude 4.5 Haiku 603、Mistral Medium 3.5 506。
Kimi K3力压GPT-5.6,国产模型最大亮点
最出人意料的排名:Kimi K3以1545 Elo力压GPT-5.6 Sol(1496)拿第二。Claude Fable 5以1583稳居冠军,Kimi K3仅落后38分,比第三名GPT-5.6高49分。从Intelligence Index到AA-Briefcase,Kimi K3排名从第3升到第2。
AA-Briefcase vs Intelligence Index:谁在裸泳
同一模型两榜位置差异巨大,说明IQ不等于工作能力。Claude Fable 5在IQ第1、Briefcase第1,全能王;Kimi K3 IQ第3、Briefcase第2,上升1位;GPT-5.6 Sol IQ第2、Briefcase第3,降1位;Grok 4.5 IQ第4、Briefcase第6,降2位;GLM-5.2 IQ第5、Briefcase第7,降2位;MiniMax-M3 IQ第8、Briefcase第9,降1位;DeepSeek V4 Pro IQ第9、Briefcase第10,降1位;Claude Sonnet 5和Claude Opus 4.8未进IQ前十却冲到Briefcase第4、第5;GPT-5.5新上榜排第8。
四个关键发现:Kimi K3上升,IQ第3到Briefcase第2超GPT-5.6;Claude Sonnet 5/Opus 4.8跃升,未进IQ前十但冲到Briefcase第4、第5;Grok 4.5/GLM-5.2下滑,IQ高但工作能力相对拉胯;GPT-5.5上榜,IQ不在前十但Briefcase排第8。
成本对比:最贵差距300倍
单次任务成本(含缓存):DeepSeek V4 Flash(max)0.01美元,DeepSeek V4 Pro(max)0.04美元,MiniMax-M3 0.10美元,GLM-5.2(max)0.51美元,GPT-5.5(xhigh)1.13美元,GPT-5.6 Sol(max)1.74美元,Kimi K3 1.80美元,Claude Sonnet 5 2.09美元,Claude Opus 4.8 3.15美元,Claude Fable 5 3.15美元以上。冠军成本是DeepSeek V4 Flash的300倍以上。
总结
Kimi K3是国产最大亮点,超GPT-5.6排第2,仅次于Claude Fable 5;Claude系统统治前三外的第二梯队,Sonnet 5、Opus 4.8双双跃升;IQ不等于工作能力,Grok 4.5和GLM-5.2在IQ榜更高但Briefcase被GPT-5.5反超;DeepSeek性价比无敌,最便宜但排名中游。
上面这些关于模型真实工作能力的评测,也是很多团队在选型时会参考的方向。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。


以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。