立即咨询

电话咨询

微信咨询

立即试用
商务合作
Kimi

Kimi K3

Kimi K3是月之暗面(Moonshot AI)于2026年7月16日正式发布的最新旗舰大模型,拥有2.8万亿参数,是全球参数规模最大的开源AI模型。模型采用MoE架构,896个专家中每次激活16个,基于独创的Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)技术构建,在百万token上下文中解码速度提升最高6.3倍。

💬
Kimi K3
Moonshot AI 月之暗面 提供
💬 对话与文本生成 付费API

Kimi K3是月之暗面(Moonshot AI)于2026年7月16日正式发布的最新旗舰大模型,拥有2.8万亿参数,是全球参数规模最大的开源AI模型。模型采用MoE架构,896个专家中每次激活16个,基于独创的Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)技术构建,在百万token上下文中解码速度提升最高6.3倍。 在性能表现方面,Kimi K3在Frontend Code Arena以1679分超越Claude Fable 5登顶第一,在Program Bench、SWE Marathon、BrowseComp、SpreadsheetBench 2和Automation Bench五项代理类基准中领先所有测试模型。在Terminal Bench 2.1上得分88.3%,接近GPT-5.6 Sol的88.8%。厂商表示K3整体智能水平接近全球领先闭源模型,在部分代理任务上已超越Fable 5和GPT-5.6 Sol。 在定价方面,Kimi K3采用扁平定价策略,100万token上下文全长度无加价。缓存未命中输入¥20/M,缓存命中输入¥2/M,输出¥100/M。厂商引用编码工作负载缓存命中率90%+,实际成本可大幅降低。相比Claude Fable 5(¥70/¥350)和GPT-5.6 Sol(¥35/¥210),K3定价显著更低。 K3原生支持文本、图像和视频文件的多模态理解,Thinking模式始终开启。模型已在Kimi.com、Kimi Work、Kimi Code和Kimi API同步上线,API兼容OpenAI SDK,模型ID为kimi-k3。开源权重承诺在7月27日前发布,如按期兑现将成为全球首个3万亿参数级别的开源模型。

对话推理代码多模态理解智能体长上下文视觉理解工具调用

📋 技术规格

厂商 Moonshot AI 月之暗面
模型分类 对话与文本生成
参数规模 2.8T(MoE, 896专家激活16)
上下文窗口 1M
最大输出 131K(可配置至1M)
知识截止 未公开
API定价 输入: ¥20.00/M(缓存未命中)输出: ¥100.00/M

⭐ 核心能力详解

2.8T参数全球最大开源MoE

896个专家中激活16个,基于Stable LatentMoE架构,参数规模为当前开源模型全球最大。

Kimi Delta Attention技术

独创KDA注意力机制,在百万token上下文中解码速度提升最高6.3倍,解决长上下文模型经济性问题。

Attention Residuals训练加速

沿深度轴为注意力状态提供残差路径,训练效率提升约25%,额外成本低于2%。

Frontend Code Arena登顶

以1679分超越Claude Fable 5,在5项代理类基准中领先所有测试模型。

100万token扁平定价

全1M上下文无分层加价,缓存命中输入仅¥2/M,编码工作负载缓存命中率90%+。

🎯 典型应用场景

为开发团队提供长程自主编程能力,分析大型代码库、协调编程工具、执行多步骤开发任务。

为知识工作平台提供端到端研究能力,结合视觉反馈进行UI设计、游戏开发和CAD辅助设计。

为企业构建多模态Agent,原生支持文本、图像和视频理解,处理复杂跨模态任务。

为深度研究场景提供百万token上下文处理能力,全长度扁平定价降低长文档处理成本。

💪 技术优势与差异化

  • 2.8T参数为开源模型全球最大,能力天花板高。
  • KDA技术将百万token解码速度提升6.3倍,长上下文经济可行。
  • 5项代理类基准领先所有测试模型,Agent能力突出。
  • 定价显著低于同级竞品,缓存命中输入仅¥2/M。
  • 承诺10天内开源权重,如按期兑现将开创3T级开源先例。

⚠️ 使用局限与注意事项

  • 在FrontierSWE和GDPval等最难的工程评测上仍落后Fable 5和GPT-5.6 Sol。
  • 开源权重尚未发布(承诺7月27日),当前仅API可用。
  • 2.8T参数即使MXFP4量化仍需64+加速器部署,自部署门槛极高。
  • Thinking模式始终开启且目前仅支持max effort,低/高模式后续推出。
  • 采样参数固定(temperature 1.0, top-p 0.95),不可调整。
  • 厂商自报benchmark需独立复现验证。

💰 价格分析与成本建议

Kimi K3采用扁平定价:缓存未命中输入¥20/M、缓存命中输入¥2/M、输出¥100/M,全1M上下文无加价。相比Claude Fable 5(¥70/¥350)成本约为其1/4-1/3,相比GPT-5.6 Sol(¥35/¥210)成本约为其1/2。厂商引用编码工作负载缓存命中率90%+,实际输入成本可低至¥4/M等效。建议企业充分利用自动缓存机制,将相似请求前缀复用以最大化缓存命中。

👥 适用人群与企业

Kimi K3主要面向:需要进行长程编程和Agent工作流的开发团队、知识工作平台、多模态应用开发商、以及追求高性价比前沿模型的企业。通过云巴巴AI大模型广场可了解Moonshot AI的Kimi K3模型信息。

🏭 行业适配度评估

软件开发★★★★★

SWE Marathon得分42.0%领先所有模型,Frontend Code Arena超越Fable 5,长程编程为核心优势

⚠ 在FrontierSWE上仍落后Fable 5,极端复杂工程任务需评估

金融★★★☆☆

百万token上下文处理长篇金融报告,Finance-Bench超越Opus 4.8

⚠ 合规认证信息未完全公开,核心金融场景需确认数据安全

政务★★★☆☆

开源权重可私有化部署,中国厂商产品信创兼容性预计较好

⚠ 等保三级认证未正式公布,2.8T参数自部署门槛极高

医疗★★★☆☆

百万上下文支持长病历分析,多模态理解辅助医学影像

⚠ 医疗数据隐私需通过私有化部署保障,自部署门槛高

教育★★★★☆

缓存命中¥2/M的极低定价适合教育平台大规模调用,编程能力突出适合CS教学

⚠ 知识截止日期未公开,时效性信息可能不准确

制造★★★☆☆

多模态理解和Agent能力可辅助产线质检和设备维护文档分析

⚠ 工业场景对实时性要求高,2.8T参数推理延迟需评估

🔧 技术架构解析

Kimi K3采用MoE架构,总参数2.8T,896个专家中每次激活16个,使用Stable LatentMoE框架。核心创新包括Kimi Delta Attention(KDA)解决长上下文解码速度问题,百万token解码提升6.3倍;Attention Residuals(AttnRes)沿深度轴提供注意力残差路径,训练效率提升25%。权重精度为MXFP4权重+MXFP8激活,推荐64+加速器超级节点部署。Thinking模式始终开启,默认max effort。固定采样参数temperature 1.0、top-p 0.95。默认最大输出131K token,可配置至1M。API兼容OpenAI SDK,模型ID为kimi-k3。K3曾对自身AttnRes的Triton实现进行优化,迭代15小时将前向+反向传播从283.6ms降至114.4ms。

🔒 安全合规与数据隐私

数据训练策略 未公开(月之暗面未明确说明API调用数据是否用于训练)
合规认证 等保三级(预计)、信创兼容(预计)
数据驻留 中国境内部署,数据存储在国内节点
加密方式 传输加密(TLS),存储加密(AES-256)
Kimi K3作为中国厂商产品,预计满足等保三级和信创兼容要求。开源权重发布后,企业可自主部署实现完全数据可控。当前API通过Kimi开放平台提供,商业用户数据隔离机制需与月之暗面确认。开源权重预计7月27日发布,企业可自行安全审计。

⚔️ Kimi K3 与同梯队前沿模型对比

竞品模型 优势 不足
Claude Fable 5 FrontierSWE和GDPval等工程评测领先 定价¥70/¥350,成本约为K3的3-4倍
GPT-5.6 Sol Terminal Bench和DeepSWE领先,生态成熟 定价¥35/¥210,成本约为K3的2倍
我们的优势:
  • 2.8T参数为开源模型全球最大
  • 5项代理类基准领先所有测试模型
  • 定价显著低于同级竞品
  • 百万上下文扁平定价无加价
  • 承诺10天内开源权重
选型建议:Kimi K3适合追求高性价比和开源可控的场景。如需最高工程能力可评估Fable 5或GPT-5.6 Sol,但成本显著更高。

🏢 同厂商模型矩阵

Moonshot AI(月之暗面)旗下Kimi系列模型定位矩阵

模型 定位 品类 特色
Kimi K3当前 当前旗舰 chat 2.8T参数开源MoE,1M上下文,Frontend Code Arena登顶,当前模型
Kimi K2.7 Code 编程专用 code K2.7系列编程优化版
Kimi K2.6 前代旗舰 chat ¥6.50/¥27,综合对话
Kimi K2.5 中端对话 chat 原生多模态,Agent Swarm
Kimi-K2-Instruct 轻量对话 chat ¥0.50/¥2.00,高性价比
Moonshot V1 128K 早期版本 chat 128K上下文,legacy支持
Kimi K3为当前Moonshot AI旗舰,2.8T参数实现开源模型能力突破。编程场景可用K2.7 Code,轻量对话用K2-Instruct,K3以更高性价比和更强Agent能力替代K2.6。开源权重发布后K3将成为自部署首选。

🧭 选型决策指南

需要长程编程和Agent工作流强烈推荐

SWE Marathon 42.0%领先所有模型,Frontend Code Arena超越Fable 5

需要百万token上下文强烈推荐

1M上下文扁平定价无加价,KDA技术保证解码速度

需要开源可自部署的前沿模型强烈推荐

2.8T参数全球最大开源模型,权重7月27日发布

预算敏感,需要高性价比强烈推荐

缓存命中¥2/M输入,整体定价为Fable 5的1/4-1/3

需要最高工程能力(FrontierSWE等)需评估

在最难工程评测上仍落后Fable 5和GPT-5.6 Sol

需要自部署但资源有限不推荐

2.8T参数需64+加速器,自部署门槛极高,建议用API

Kimi K3适合追求高性价比、长程编程和开源可控的场景。5项代理基准领先所有模型,定价显著低于竞品。如需最高工程能力可评估Fable 5,但成本3-4倍于K3。

🏆 真实使用案例

📌 某开发团队使用K3进行大型项目编程

应用场景:对百万行级代码库进行自主分析和Bug修复
实际效果:K3可分析完整代码库并协调多步骤开发任务,视觉反馈机制辅助UI调试
SWE Marathon得分42.0%领先所有测试模型

📌 某知识工作平台使用K3进行深度研究

应用场景:结合百万token上下文处理长篇研究报告和多源数据分析
实际效果:1M上下文全长度扁平定价,无长文档加价
BrowseComp得分91.2%领先所有测试模型

💬 用户真实评价

AI开发者
⭐⭐⭐⭐

开源2.8T参数是里程碑事件,Frontend Code Arena超越Fable 5令人印象深刻。期待7月27日权重发布。

企业架构师
⭐⭐⭐⭐

定价很有竞争力,缓存命中¥2/M输入非常实惠。但自部署门槛太高,64+加速器不是一般企业能承担的。

前端开发者
⭐⭐⭐⭐

在Code Arena上体验了K3,前端代码生成能力确实强。Thinking始终开启的模式有时会过度主动,期待后续low/high模式。

✅ 最佳实践建议

1. 最大化缓存命中**:将通用系统提示和上下文前缀复用,编码工作负载缓存命中率可达90%+,输入成本降至¥2/M。
2. 利用百万上下文**:全长度扁平定价无加价,可放心传入完整代码库和长文档,无需分段处理。
3. 接受Thinking模式**:K3的Thinking始终开启,设计工作流时预留推理时间,复杂任务效果更优。
4. 视觉反馈循环**:利用原生多模态能力,让K3查看截图后修改代码再验证结果,形成vision-in-the-loop工作流。
5. 关注开源发布**:7月27日权重发布后评估自部署可行性,但需确认拥有64+加速器资源。

💡 Prompt工程建议

利用Vision-in-the-Loop工作流

K3原生支持视觉理解,可以让模型查看截图后修改代码再验证结果,形成视觉反馈循环。

示例:让K3生成UI代码后截图,附上截图说明'请检查界面布局并修复问题',比纯文字描述更有效。

最大化缓存命中率

将通用系统提示和上下文前缀复用,编码工作负载缓存命中率可达90%+,输入成本降至¥2/M。

示例:将项目说明和代码规范放在请求开头作为固定前缀,多轮对话复用此前缀触发缓存。

接受Thinking始终开启

K3的Thinking模式始终开启且为max effort,复杂任务效果更优,设计工作流时预留推理时间。

示例:不要急于在模型思考时发送新消息,等待Thinking完成后会给出更完整的分析和方案。

利用百万上下文不分段

全1M上下文扁平定价无加价,可放心传入完整代码库和长文档。

示例:将完整项目代码一次性传入,比分段处理效果更好,KDA技术保证长上下文解码速度。

🔄 替代方案分析

需要最高工程能力(超越K3)
Claude Fable 5 (¥70/¥350)GPT-5.6 Sol (¥35/¥210)

这些模型在FrontierSWE和GDPval等最难评测上领先K3,但成本3-4倍于K3。

成本优先(比K3更便宜)
GPT-5.6 Luna (¥7/¥42)腾讯混元Hy3 (¥1/¥4)Kimi-K2-Instruct (¥0.50/¥2)

这些模型定价更低,但参数规模和能力上限不及K3。

需要开源可自部署(资源有限)
DeepSeek V4-Flash (284B)Llama 4 Maverick腾讯混元Hy3 (295B)

K3的2.8T参数自部署门槛极高,这些模型参数更小更易部署。

需要更多编程专用优化
Kimi K2.7 CodeGrok 4.5GPT-5.1-Codex-Max

K3为通用旗舰,编程专用场景可考虑更轻量的编程优化模型。

需要闭源商业API稳定性
GPT-5.6 SolClaude Opus 4.8Grok 4.5

K3刚发布,API稳定性有待验证。生产环境可考虑更成熟的商业API。

❓ 常见问题解答

Q: Kimi K3是什么类型的AI模型?
A: Kimi K3是月之暗面发布的2.8万亿参数开源MoE旗舰模型,原生支持多模态理解,100万token上下文,面向长程编程和知识工作。
Q: Kimi K3是开源的吗?
A: 承诺7月27日前发布开源权重,预计采用Modified MIT许可证。当前仅API可用。
Q: Kimi K3的定价是多少?
A: 缓存未命中输入¥20/M,缓存命中输入¥2/M,输出¥100/M,全1M上下文无分层加价。
Q: Kimi K3与其他前沿模型相比如何?
A: 在5项代理类基准中领先所有测试模型,Frontend Code Arena以1679分超越Claude Fable 5。但在最难的工程评测上仍落后Fable 5和GPT-5.6 Sol。
Q: Kimi K3可以自部署吗?
A: 2.8T参数即使MXFP4量化仍需64+加速器部署,自部署门槛极高。建议大多数用户使用API。