Kimi K3是月之暗面(Moonshot AI)于2026年7月16日正式发布的最新旗舰大模型,拥有2.8万亿参数,是全球参数规模最大的开源AI模型。模型采用MoE架构,896个专家中每次激活16个,基于独创的Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)技术构建,在百万token上下文中解码速度提升最高6.3倍。 在性能表现方面,Kimi K3在Frontend Code Arena以1679分超越Claude Fable 5登顶第一,在Program Bench、SWE Marathon、BrowseComp、SpreadsheetBench 2和Automation Bench五项代理类基准中领先所有测试模型。在Terminal Bench 2.1上得分88.3%,接近GPT-5.6 Sol的88.8%。厂商表示K3整体智能水平接近全球领先闭源模型,在部分代理任务上已超越Fable 5和GPT-5.6 Sol。 在定价方面,Kimi K3采用扁平定价策略,100万token上下文全长度无加价。缓存未命中输入¥20/M,缓存命中输入¥2/M,输出¥100/M。厂商引用编码工作负载缓存命中率90%+,实际成本可大幅降低。相比Claude Fable 5(¥70/¥350)和GPT-5.6 Sol(¥35/¥210),K3定价显著更低。 K3原生支持文本、图像和视频文件的多模态理解,Thinking模式始终开启。模型已在Kimi.com、Kimi Work、Kimi Code和Kimi API同步上线,API兼容OpenAI SDK,模型ID为kimi-k3。开源权重承诺在7月27日前发布,如按期兑现将成为全球首个3万亿参数级别的开源模型。
📋 技术规格
| 厂商 | Moonshot AI 月之暗面 |
|---|---|
| 模型分类 | 对话与文本生成 |
| 参数规模 | 2.8T(MoE, 896专家激活16) |
| 上下文窗口 | 1M |
| 最大输出 | 131K(可配置至1M) |
| 知识截止 | 未公开 |
| API定价 | 输入: ¥20.00/M(缓存未命中)输出: ¥100.00/M |
⭐ 核心能力详解
2.8T参数全球最大开源MoE
896个专家中激活16个,基于Stable LatentMoE架构,参数规模为当前开源模型全球最大。
Kimi Delta Attention技术
独创KDA注意力机制,在百万token上下文中解码速度提升最高6.3倍,解决长上下文模型经济性问题。
Attention Residuals训练加速
沿深度轴为注意力状态提供残差路径,训练效率提升约25%,额外成本低于2%。
Frontend Code Arena登顶
以1679分超越Claude Fable 5,在5项代理类基准中领先所有测试模型。
100万token扁平定价
全1M上下文无分层加价,缓存命中输入仅¥2/M,编码工作负载缓存命中率90%+。
🎯 典型应用场景
为开发团队提供长程自主编程能力,分析大型代码库、协调编程工具、执行多步骤开发任务。
为知识工作平台提供端到端研究能力,结合视觉反馈进行UI设计、游戏开发和CAD辅助设计。
为企业构建多模态Agent,原生支持文本、图像和视频理解,处理复杂跨模态任务。
为深度研究场景提供百万token上下文处理能力,全长度扁平定价降低长文档处理成本。
💪 技术优势与差异化
- 2.8T参数为开源模型全球最大,能力天花板高。
- KDA技术将百万token解码速度提升6.3倍,长上下文经济可行。
- 5项代理类基准领先所有测试模型,Agent能力突出。
- 定价显著低于同级竞品,缓存命中输入仅¥2/M。
- 承诺10天内开源权重,如按期兑现将开创3T级开源先例。
⚠️ 使用局限与注意事项
- 在FrontierSWE和GDPval等最难的工程评测上仍落后Fable 5和GPT-5.6 Sol。
- 开源权重尚未发布(承诺7月27日),当前仅API可用。
- 2.8T参数即使MXFP4量化仍需64+加速器部署,自部署门槛极高。
- Thinking模式始终开启且目前仅支持max effort,低/高模式后续推出。
- 采样参数固定(temperature 1.0, top-p 0.95),不可调整。
- 厂商自报benchmark需独立复现验证。
💰 价格分析与成本建议
Kimi K3采用扁平定价:缓存未命中输入¥20/M、缓存命中输入¥2/M、输出¥100/M,全1M上下文无加价。相比Claude Fable 5(¥70/¥350)成本约为其1/4-1/3,相比GPT-5.6 Sol(¥35/¥210)成本约为其1/2。厂商引用编码工作负载缓存命中率90%+,实际输入成本可低至¥4/M等效。建议企业充分利用自动缓存机制,将相似请求前缀复用以最大化缓存命中。
👥 适用人群与企业
Kimi K3主要面向:需要进行长程编程和Agent工作流的开发团队、知识工作平台、多模态应用开发商、以及追求高性价比前沿模型的企业。通过云巴巴AI大模型广场可了解Moonshot AI的Kimi K3模型信息。
🏭 行业适配度评估
SWE Marathon得分42.0%领先所有模型,Frontend Code Arena超越Fable 5,长程编程为核心优势
⚠ 在FrontierSWE上仍落后Fable 5,极端复杂工程任务需评估
百万token上下文处理长篇金融报告,Finance-Bench超越Opus 4.8
⚠ 合规认证信息未完全公开,核心金融场景需确认数据安全
开源权重可私有化部署,中国厂商产品信创兼容性预计较好
⚠ 等保三级认证未正式公布,2.8T参数自部署门槛极高
百万上下文支持长病历分析,多模态理解辅助医学影像
⚠ 医疗数据隐私需通过私有化部署保障,自部署门槛高
缓存命中¥2/M的极低定价适合教育平台大规模调用,编程能力突出适合CS教学
⚠ 知识截止日期未公开,时效性信息可能不准确
多模态理解和Agent能力可辅助产线质检和设备维护文档分析
⚠ 工业场景对实时性要求高,2.8T参数推理延迟需评估
🔧 技术架构解析
Kimi K3采用MoE架构,总参数2.8T,896个专家中每次激活16个,使用Stable LatentMoE框架。核心创新包括Kimi Delta Attention(KDA)解决长上下文解码速度问题,百万token解码提升6.3倍;Attention Residuals(AttnRes)沿深度轴提供注意力残差路径,训练效率提升25%。权重精度为MXFP4权重+MXFP8激活,推荐64+加速器超级节点部署。Thinking模式始终开启,默认max effort。固定采样参数temperature 1.0、top-p 0.95。默认最大输出131K token,可配置至1M。API兼容OpenAI SDK,模型ID为kimi-k3。K3曾对自身AttnRes的Triton实现进行优化,迭代15小时将前向+反向传播从283.6ms降至114.4ms。
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(月之暗面未明确说明API调用数据是否用于训练) |
|---|---|
| 合规认证 | 等保三级(预计)、信创兼容(预计) |
| 数据驻留 | 中国境内部署,数据存储在国内节点 |
| 加密方式 | 传输加密(TLS),存储加密(AES-256) |
⚔️ Kimi K3 与同梯队前沿模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| Claude Fable 5 | FrontierSWE和GDPval等工程评测领先 | 定价¥70/¥350,成本约为K3的3-4倍 |
| GPT-5.6 Sol | Terminal Bench和DeepSWE领先,生态成熟 | 定价¥35/¥210,成本约为K3的2倍 |
- 2.8T参数为开源模型全球最大
- 5项代理类基准领先所有测试模型
- 定价显著低于同级竞品
- 百万上下文扁平定价无加价
- 承诺10天内开源权重
🏢 同厂商模型矩阵
Moonshot AI(月之暗面)旗下Kimi系列模型定位矩阵
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Kimi K3当前 | 当前旗舰 | chat | 2.8T参数开源MoE,1M上下文,Frontend Code Arena登顶,当前模型 |
| Kimi K2.7 Code | 编程专用 | code | K2.7系列编程优化版 |
| Kimi K2.6 | 前代旗舰 | chat | ¥6.50/¥27,综合对话 |
| Kimi K2.5 | 中端对话 | chat | 原生多模态,Agent Swarm |
| Kimi-K2-Instruct | 轻量对话 | chat | ¥0.50/¥2.00,高性价比 |
| Moonshot V1 128K | 早期版本 | chat | 128K上下文,legacy支持 |
🧭 选型决策指南
SWE Marathon 42.0%领先所有模型,Frontend Code Arena超越Fable 5
1M上下文扁平定价无加价,KDA技术保证解码速度
2.8T参数全球最大开源模型,权重7月27日发布
缓存命中¥2/M输入,整体定价为Fable 5的1/4-1/3
在最难工程评测上仍落后Fable 5和GPT-5.6 Sol
2.8T参数需64+加速器,自部署门槛极高,建议用API
🏆 真实使用案例
📌 某开发团队使用K3进行大型项目编程
📌 某知识工作平台使用K3进行深度研究
💬 用户真实评价
开源2.8T参数是里程碑事件,Frontend Code Arena超越Fable 5令人印象深刻。期待7月27日权重发布。
定价很有竞争力,缓存命中¥2/M输入非常实惠。但自部署门槛太高,64+加速器不是一般企业能承担的。
在Code Arena上体验了K3,前端代码生成能力确实强。Thinking始终开启的模式有时会过度主动,期待后续low/high模式。
✅ 最佳实践建议
💡 Prompt工程建议
利用Vision-in-the-Loop工作流
K3原生支持视觉理解,可以让模型查看截图后修改代码再验证结果,形成视觉反馈循环。
最大化缓存命中率
将通用系统提示和上下文前缀复用,编码工作负载缓存命中率可达90%+,输入成本降至¥2/M。
接受Thinking始终开启
K3的Thinking模式始终开启且为max effort,复杂任务效果更优,设计工作流时预留推理时间。
利用百万上下文不分段
全1M上下文扁平定价无加价,可放心传入完整代码库和长文档。
🔄 替代方案分析
这些模型在FrontierSWE和GDPval等最难评测上领先K3,但成本3-4倍于K3。
这些模型定价更低,但参数规模和能力上限不及K3。
K3的2.8T参数自部署门槛极高,这些模型参数更小更易部署。
K3为通用旗舰,编程专用场景可考虑更轻量的编程优化模型。
K3刚发布,API稳定性有待验证。生产环境可考虑更成熟的商业API。








首页 


