立即咨询

电话咨询

微信咨询

立即试用
商务合作

Kimi K3 深度评测:开源新 SOTA 到底多强

2026-07-31

 

 

Kimi K3 正式发布,开源模型的 SOTA 宝座又一次换人坐了。

 

发布当晚我刷 X 的时候,时间线已经被各种好评淹没。这种程度的口碑反馈,自 DeepSeek R1 之后就再没见过。

 

 

连 a16z 的投资人都公开表态了:

 

 

我有个习惯,每次有新模型上线,都先去读官方团队发布的 Blog。原因很简单:这些文章通常经过核心研究员、产品负责人乃至 CEO 的多轮确认,模型到底解决了什么问题、更新了哪些关键能力、团队最看重的方向是什么,都会写得很清楚。社交平台上的讨论虽然热闹,但情绪化内容太多,有效信息反而被稀释。

 

 

一、先用真实业务场景跑一遍再说

 

光看 Blog 不够,我直接拿几个真实生产环境的任务来测。

 

第一个是 AI Maker Summit 大会的电子门票。以前的电子门票做得比较简陋,这次我用 K3 生成了一张带物理质感的门票,表面有细微的颗粒感和印刷纹理。做完以后团队都觉得效果不错。乔布斯说过,认真做的东西用户是能感受到的,不用刻意去讲。下面是 Kimi Code 里的实现截图。

 

 

第二个是一个手风琴折叠加翻页效果。K3 在推理和执行上的进步很明显:第一版做出来卡片重叠、交互很糟,它自己 Review 了屏幕效果后,重新计算了墙面宽度、卡片旋转轴和横向位移,很快锁定了问题。这种长程编程任务里的自我纠偏能力,确实是 K3 的亮点。

 

 

第三个是大会网站的概览页面,交互动画效果不错。紧接着我把大会的交易系统也用 K3 重构了一遍:之前购票走的是第三方 SaaS,这次前后端全部迁到自有平台。有一说一,K3 除了响应速度偏慢,其他方面我觉得已经比 Opus 4.8 更顺手了。

 

中间跑交易系统的时候模型报了一次错,排查下来应该是算力吃紧,当天涌入的用户不少。群里好几个人说要重新给 Kimi 续费了。美国用户在 Anthropic 和 OpenAI 之间反复横跳,国内是不是也开始在 GLM 和 Kimi 之间来回选了?

 

交易系统里批量填写参会者信息这个功能,是 K3 自己加的,我觉得做得挺好。

 

 

微信和支付宝的支付通道也接好了:

 

 

对应的 CMS 后台:

 

 

系统跑通以后,我让 K3 对整条支付链路做了一次安全审计。

 

 

大约 15 分钟后,它给出了审计报告:

 

 

我拿 GPT 5.6 Sol 做了交叉验证,80% 的结论是准确的。

 

 

二、不带情绪的五点判断

 

跑完上面这些 Case,说几点真实感受。

 

第一,K3 在推理深度和长程任务表现上确实超过了 GLM 5.2,整体水准跟 Opus 4.8 基本持平。

 

第二,国内定价不算便宜,但跟 Opus 4.8 比仍然有约 3/4 的价格优势。

 

第三,我用的是 Kimi Coding Plan,体感上比 2.x 系列更耐用。

 

第四,自主推进项目的意识非常强。比如做安全审计的时候,我一直强调不要动代码、只做分析,它确实遵守了。

 

第五,价格要是能再降一些就更好了。

 

三、技术层面:K3 凭什么做到这个水准

 

读完 Blog 的关键信息,我的第一判断是:K3 基本到顶了。2.8 万亿参数的规模,全球能把这个量级的模型真正训练出来并完成部署的团队,一只手数得过来。

 

参数量看起来只是个数字,但到了万亿这个级别,复杂度会陡然上升。训练周期长,中间任何波动都可能造成巨大损失。算力投入、数据质量、训练稳定性,每一环都不能出问题。国内做到万亿级预训练的只有 DeepSeek 和月之暗面,超过 2 万亿的只有月之暗面一家。

 

Blog 的信息结构是倒金字塔式的,最重要的内容放在最前面。几条核心信息:

 

一、2.8T 参数,目前全球开源模型里规模最大的。

 

二、采用混合线性注意力机制加注意力残差,这两项是 Kimi 过去最核心的技术积累。

 

三、原生多模态。

 

四、100 万上下文。

 

五、面向长程编程、知识工作和推理场景设计。

 

六、仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型。

 

混合线性注意力和注意力残差这两项技术,Kimi 之前分别发过论文,现在回头看,都是在给 K3 铺路。

 

 

先说混合线性注意力。传统注意力机制好比读一篇长文,每读到新内容都要回头翻前面的段落,确认哪些信息跟当前有关。好处是查得细致,但文章一长,计算量和缓存压力就直线上升。KDA 换了个思路,更像一边读一边在维护一份动态笔记:新信息进来后把有用的写进去,不太重要的逐渐淡出,后续处理新内容时不必每次都把全部历史重新算一遍。光靠笔记可能会丢细节,所以 Kimi 走的是混合路线:部分层用 KDA 提效,部分层保留 MLA 做精确查找。大部分时候翻笔记,必要时回原文,既压低了超长上下文的成本,又尽量保住了细节理解。

 

再说注意力残差。大模型的层很多,信息从第一层逐层往后传递。传统残差连接是在前一层的输出上叠加新信息,层数不多时问题不大,但模型一深,早期层提取的关键信息会被后续内容稀释,传到后面可能已经面目模糊。打个比方,很多人接力改一篇文章,传统的做法是每人只拿到前一版的稿子往上加,改了十几轮后,最早几位留下的重要判断已经埋在厚厚的文稿里很难找到了。注意力残差给了后面的编辑一个额外选项:写到某个位置时,不止看上一版,还能翻阅前面不同阶段的版本,把当前最需要的内容重新拎出来。它解决的是模型变深之后信息传递的问题。KDA 管的是上下文长度的效率,注意力残差管的是模型深度方向的信息保真,两者搭配,让信息在更长的序列和更深的网络里都能流动顺畅。

 

 

四、跟闭源模型到底差多少

 

X 上有人直接说 K3 超过了 Claude Fable 5,这个说法我觉得过头了。官方 Blog 里也坦承跟顶尖闭源模型还有差距,不过达到 Opus 4.8 的水平应该是没什么争议的。

 

开源和闭源之间的差距正在被压缩到三个月以内,这个说法在 X 上讨论度很高。虽然很难精确验证,但 K3 站到当前开源 SOTA 的位置,基本没有异议。

 

五、苏轼那句话

 

K3 发布 Blog 的第一句是:

 

犯其至难而图其至远者,发之以勇,守之以专,达之以强。

 

出自苏轼的《思治论》。大意是:去做最难的事、追求最远的目标,出发时靠勇气开路,行进中靠专注守方向,抵达时靠长期磨出的韧劲和力量。这句话放在 Kimi 这几年的经历上,意外地贴切。

 

大模型刚起风的时候,Kimi 是国内最早入局的一批,也是最受关注的明星公司。杨植麟被媒体频繁报道,很多人觉得他是这一代大模型创业者里技术天赋最高的。但后面的路并不顺:字节在应用端猛砸资源,豆包迅速做大,Kimi 被拉进投流混战;DeepSeek R1 发布后,连李开复都说其他模型没戏了,那段时间 Kimi 的声量明显收缩;再后来 Kimi 砍掉应用端投流、把重心挪回模型研发,K2 出来后口碑不错,但行业迭代太快,没多久又被新模型盖过。

 

这一次 K3 回来了。它大概率也不是终点,按现在的节奏,过几个月可能又有新模型刷新认知。但至少在这一刻,K3 让人眼前一亮,它代表了国产模型目前能达到的新高度。

 

回头再看苏轼那句话,发之以勇、守之以专、达之以强,Kimi 这两年走的就是这条路。国产模型加油,我也不想一边被人嫌弃、一边又憋屈地用 Anthropic 的模型。

 

 

上面这些对 Kimi K3 的实测和判断,其实也是很多团队在选型时会关心的维度。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。

热门数字化产品

Zoho Projects项目管理软件Zoho Projects项目管理软件,帮助您轻松地进行项目规划、进度跟踪、内外协作。它利用工时统计、Bug管理、项目知识库管理等功能,帮助您实现业务目标。为您的项目管理工作提供全面综合的解决方案,从而帮助您和您的企业大幅创造价值。
飞扬UTMS物流管理云系统飞扬UTMS物流管理云系统,SaaS UTMS云系统,飞速部署,在线升级;电脑端手机端功能及数据全部打通,小程序比app更轻更方便,随时随地移动办公,数据统计随时看;系统内置丰富营销工具,按需选用借助微信生态,有效拉客获客,先人一步掌握成交机会。
百度智能云曦灵智能数字人平台百度智能云曦灵-智能数字人平台,致力于打造智能的服务型&演艺型数字人,面向金融、媒体,运营商、MCN,互娱等行业,提供全新客户体验及服务。该平台可进一步降低数字人应用门槛,实现人机可视化语音交互服务和内容生产服务,有效提升用户体验、降低人力成本,提升服务质量和效率。
跨境云手机跨境云手机,基于自主知识产权的磐玉蜂巢服务器及创新的容器化技术, 跨境云产品以“ 高安全性、高能效比、高性价比” 为价值理念, 持续构建丰富的ARM云产品矩阵, 帮助客户以更低成本获得安全稳定、绿色节能、高效敏捷的ARM云服务和云算力,为跨境直播带货,海外市场营销和进出口贸易,跨境电商出海创造更多可能。
为你推荐
WorkBuddy 视频拆解实战:3 分钟提炼 1 小时视频大纲

用 WorkBuddy 把长视频的转写、分段、提炼、标片段合成一步,1 小时视频 3 分钟出结构化大纲与剪辑素材,含可复制指令与四个避坑点。

2026-09-04
ChatGPT 接入公司流程的三条路径:API 调用、账号集中管、企业版

ChatGPT 接入公司流程三条路径:API 调用上限高但吃研发、账号集中管零开发快速铺开、企业版合规完整但门槛重,组合拳首年省八万六覆盖全需求。

2026-09-04
ChatGPT Plus 值不值得公司报销?行政定报销政策前的五条判断线

AI 工具订阅报销政策五条判断线:岗位相关按产出关联筛、用量证据三选一防空转、封顶额度跟金额挂钩审批、工具产出归公司、超临界点转团队订阅,落地月省四成零争议。

2026-09-04
ChatGPT Canvas 协作写方案:初稿、批注、定稿三个动作的真实体验

ChatGPT Canvas 协作写方案三动作:初稿先骨架后血肉分段生长、批注选区加指令就地改免搬运、定稿反方质询加格式检查,方案初稿周期三天压一天半。

2026-09-04
50 人公司适合上 ChatGPT 企业版吗?按 SSO 管控与数据驻留两条硬需求判断

50 人公司上 ChatGPT 企业版的两条硬需求判断法:SSO 看认证审计约束、数据驻留看客户合同条款,组合矩阵给出全员企业版、混合配置、团队版三个落点。

2026-09-04
查看更多