立即咨询

电话咨询

微信咨询

立即试用
商务合作
Kimi

Kimi Linear

Kimi Linear是月之暗面2025年10月发布的48B MoE轻量级模型,每token仅激活3B参数,支持128K上下文,专为边缘部署和资源受限环境设计,可在消费级硬件上流利运行。

💬
Kimi Linear
Moonshot AI 月之暗面 提供
💬 对话与文本生成 付费API

Kimi Linear是月之暗面于2025年10月发布的轻量级MoE大模型,采用48B总参数、3B激活参数的紧凑架构,专为边缘部署和资源受限环境设计。模型在保持较小体积的同时提供了令人惊讶的性能,支持128K上下文窗口,可在消费级硬件上流利运行。 在定位方面,Kimi Linear填补了Kimi产品线中轻量级部署的空白。当K2.5等万亿参数模型需要专业GPU集群时,Kimi Linear可在普通消费级显卡上运行,适合本地部署、移动端应用和高吞吐低延迟场景。48B MoE架构通过稀疏激活实现高效推理,每token仅激活3B参数,在保证能力的同时大幅降低计算资源需求。 Kimi Linear适合需要Kimi品质但资源有限的场景:移动端AI助手、边缘设备智能交互、高并发低延迟客服、以及需要本地部署保障数据隐私的企业应用。虽然能力上限不及K2.5/K3等旗舰模型,但在轻量级场景中提供了出色的性价比。

对话推理代码长上下文边缘部署

📋 技术规格

厂商 Moonshot AI 月之暗面
模型分类 对话与文本生成
参数规模 48B(MoE, 激活3B)
上下文窗口 128K
最大输出 未公开
知识截止 未公开
API定价 输入: 未公开输出: 未公开

⭐ 核心能力详解

48B MoE紧凑架构

总参数48B,每token仅激活3B,通过稀疏激活实现高效推理。

消费级硬件可运行

可在普通消费级显卡上流利运行,降低部署门槛。

128K上下文支持

支持128K上下文窗口,处理长文档和多轮对话。

边缘部署优化

专为边缘设备和资源受限环境设计,适合移动端和IoT场景。

🎯 典型应用场景

为移动端AI助手提供本地推理能力,无需云端依赖。

为高并发客服场景提供低延迟响应,3B激活参数降低推理成本。

为数据隐私敏感的企业提供本地部署方案,Modified MIT开源可商用。

为IoT和边缘设备提供智能交互能力,资源消耗极低。

💪 技术优势与差异化

  • 48B参数可在消费级硬件运行,部署门槛极低。
  • 3B激活参数推理成本低,适合高并发场景。
  • Modified MIT开源可商用,支持自主部署。
  • 128K上下文覆盖大多数应用场景。

⚠️ 使用局限与注意事项

  • 能力上限远不及K2.5/K3等旗舰模型。
  • 定价和详细规格未公开。
  • 多模态能力有限,主要为文本模型。
  • 知识截止日期未公开。
  • 在复杂推理任务上表现受限。

💰 价格分析与成本建议

Kimi Linear定价未公开,作为开源模型可自行部署,部署成本仅为硬件成本。48B MoE架构在消费级显卡上即可运行,硬件门槛远低于万亿参数模型。

👥 适用人群与企业

Kimi Linear主要面向:需要边缘部署的移动端应用开发商、高并发低延迟客服平台、数据隐私敏感的本地部署企业、以及IoT和边缘设备开发者。

🔧 技术架构解析

Kimi Linear采用48B MoE架构,每token激活3B参数,支持128K上下文。Modified MIT开源协议,可在开源模型社区获取权重。模型针对消费级硬件优化,可通过vLLM、SGLang等框架本地部署。

⚔️ Kimi Linear 与同类型轻量模型对比

竞品模型 优势 不足
Llama 3.2 3B 参数更小更轻 能力上限更低
Phi-3 Medium 微软生态支持 非MoE架构
我们的优势:
  • 48B MoE在轻量级中能力较强
  • 128K上下文支持
  • Modified MIT开源可商用
  • 消费级硬件可运行
选型建议:Kimi Linear适合需要Kimi品质但资源有限的场景。如需最高能力用K3,如需更轻量用Llama 3.2。

🏆 真实使用案例

📌 某移动应用使用Kimi Linear本地推理

应用场景:在手机端本地运行AI助手,无需云端依赖
实际效果:3B激活参数在移动芯片上流利运行,响应延迟低
云端调用成本降低100%

💬 用户真实评价

移动端开发者
⭐⭐⭐⭐

48B MoE在手机上能跑起来很惊喜,3B激活参数延迟很低。适合不需要旗舰级能力的轻量场景。

企业运维
⭐⭐⭐

开源可自部署是最大优势,Modified MIT协议对商用友好。但能力跟K2.5差距明显。

✅ 最佳实践建议

1. 评估能力需求**:Linear适合轻量场景,复杂任务用K2.5或K3。
2. 利用开源自部署**:Modified MIT可商用,自行部署消除API成本。
3. 移动端优化**:3B激活参数适合移动芯片,配合量化进一步降低资源需求。

❓ 常见问题解答

Q: Kimi Linear是什么类型的AI模型?
A: Kimi Linear是月之暗面发布的48B MoE轻量级模型,每token激活3B参数,专为边缘部署设计。
Q: Kimi Linear可以在普通电脑上运行吗?
A: 可以,48B MoE架构可在消费级显卡上流利运行,部署门槛远低于旗舰模型。
Q: Kimi Linear是开源的吗?
A: 是的,采用Modified MIT协议开源,可在开源模型社区获取权重,可商用。

产品问答

提问
企业上Kimi API要准备什么?部署和接入有哪些步骤?
avatar
qo8cr5zq回答:
企业上Kimi API,准备工作集中在账号认证、密钥获取、网络与安全配置三个方向 其中企业认证是必须跨过的第一道门槛。 企业账号认证是接入的必经步骤。 企业需要登录开放平台完成企业认证,准备企业名称、与企业名称一致的银行账号、统一社会信用代码。平台会向企业对公账户打款随机金额用于验证,财务确认后填入即可通过。 企业认证相比个人认证,可申请更高速率限制、支持签署商务合同、享受优先技术支持。认证状态支持从个人升级为企业,但不可逆。 API Key获取与权限管理。 认证通过后,在控制台创建密钥。该密钥需妥善保管,生产环境应通过环境变量注入,避免明文存储在代码或配置文件中。密钥不得在前端浏览器代码中直接调用。 企业可根据业务需求创建多个子账户进行团队协作。如遇密钥泄露,立即在控制台撤销并重新生成。 网络与安全配置。 所有API通信使用HTTPS/TLS加密传输。生产环境部署时需配置完整的SSL/TLS证书链,TLS 1.3是最低安全标准。 该工具的数据不会被用于模型训练,不同用户的数据严格隔离。内容安全审查机制自动检测并过滤违规内容。如果业务在海外调用,需确认网络环境是否稳定。 准备阶段的决策要点: 先完成企业认证再申请密钥,提前准备好营业执照和银行账户信息。密钥从创建第一天就按生产标准管理,不要等出了问题再补救。
提问
代码项目选Kimi K2.7 Code还是K3?编程场景怎么选?
avatar
62fhxb4k回答:
代码项目选Kimi K2.7 Code还是K3,本质上是选编程专用工具还是全能旗舰 两者定位完全不同。 K2.7 Code是月之暗面开发的聚焦编程的Agentic模型,专为代码生成、编辑和Agent开发任务打造。它基于K2系列,通过Mixture-of-Experts架构实现高效推理。 而K3是月之暗面迄今为止能力最强的旗舰模型,面向软件工程、知识工作和深度推理等前沿智能场景设计。 Kimi K2.7 Code与K3的核心差异 定位不同。 K2.7 Code是编程专家,把K2系列的能力集中在代码生成、编辑和Agent开发任务上。K3是全能旗舰,编程只是其强能力之一,同时覆盖通用Agent、视觉推理、知识工作等多领域。 月之暗面官方明确表示:如果是写作、分析、对话等通用工作,推荐使用K2.6;K2.7 Code专为编程任务打造。而K3则是"迄今为止编程能力最强的模型"。 上下文窗口差异。 K2.7 Code支持256K上下文,足以覆盖中型代码库。K3支持100万tokens上下文窗口,"把整个代码库交给模型"从理想变成了现实。部分工具默认上下文窗口并非最高1M,需要手动将上下文窗口字段配置为1048576才能用满。 成本差距。 在相同调用量下,K3的综合成本约为K2.7 Code的4倍左右。不过K3编程场景缓存率超过90%,实际输入成本会低不少。 简而言之: K2.7 Code是"编程特长生"——专注、高效、便宜;K3是"全能旗舰"——更强、更大、更贵。选哪个,取决于你的任务需要多强的能力,以及预算能承受多大的成本。
提问
Kimi K3需要充值多少才能用?新用户优惠能用吗?
avatar
d2ecmodt回答:
使用Kimi K3需要单独充值,新用户的15元代金券不可用于该模型 这是由K3的旗舰定位决定的。 Kimi K3为什么不能使用15元代金券 先看清K3的定价逻辑。 该模型是月之暗面推出的2.8万亿参数旗舰模型,也是全球首个开源的3万亿级别模型。它的API定价分为三档:输入20元/百万token(缓存未命中)、输入2元/百万token(缓存命中)、输出100元/百万token。 借助Mooncake分离式推理架构,编程场景缓存率超过90%,实际输入成本可降至标准价格的1/4。 那新用户的15元代金券是怎么回事? Kimi开放平台为新用户提供15元代金券,注册即赠送,完成实名认证后发放。但官方明确说明:15元代金券不可用于体验Kimi K3。代金券仅适用于平台上的其他模型,K3需要单独充值后解锁使用。 为什么要单独充值? K3的定位决定了它的门槛。该模型的API定价比上一代旗舰K2.6的输入价格上涨208%,输出价格上涨270%。输出100元/百万token的价格已进入海外闭源前沿模型的价格区间。算力成本高,自然需要付费用户来支撑。 同时,K3上线不到48小时,月之暗面就宣布暂停C端新用户订阅,原因是请求量远超预期,现有GPU集群接近负载上限。有限的算力需要优先保障付费用户,新用户免费体验K3的路径自然被收紧。 15元代金券能用在哪? 代金券可用于Kimi开放平台上的其他模型调用,比如K2.6、K2.7 Code等。数百次标准对话请求、数十次长文档解析、接口联调和功能验证都足够覆盖。但如果你想体验K3的能力,就需要直接充值。