Muse Spark 1.2是Meta超级智能实验室继Muse Spark 1.1(7月16日)之后推出的编程专用升级版,于2026年8月5日随终端编程智能体Muse Code(beta)一同发布。这是Meta四个月内发布的第三款Muse系列模型,定位直接对标Anthropic的Claude Code与OpenAI的Codex。Meta表示,本次升级显著扩大了编程任务的训练算力,同时扩展了训练环境多样性,与Muse Code协同训练,专注于长程智能体软件工程:理解大型代码仓库、协调多个子智能体、并持续迭代直至任务目标达成。模型保留了Muse Spark 1.1的1,048,576 token上下文窗口与多模态输入能力(文本、图像、视频、PDF,文本输出),定价与1.1持平为每百万token输入1.25美元、输出4.25美元,缓存命中0.15美元。Meta公布的基准显示,Muse Spark 1.2在Terminal-Bench 2.1取得82.9%(1.1为76.2%),DeepSWE 1.1取得59.3%(1.1为53.0%),Meta内部编程基准70.6%,在Meta发布的对比中位列Terminal-Bench第二、DeepSWE第三,均仅次于Claude Opus 5。Artificial Analysis智能指数达到57,为Meta迄今最高。模型通过Meta Model API与OpenRouter提供服务,并设有反馈门控的贡献者层级(Contributor Tier),定价约低12倍(输入0.10美元/输出0.20美元)。Muse Code可通过单条命令在macOS和Linux安装,定位为开发者本地终端编程助手。
📋 技术规格
| 厂商 | Meta AI |
|---|---|
| 模型分类 | 代码生成与编程 |
| 参数规模 | 未公开(Meta未披露Muse Spark系列参数规模) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大输出 | 131,072 tokens |
⭐ 核心能力详解
编程专用升级:通过自改进训练循环与Muse Code协同训练,聚焦长程软件工程
1M超长上下文:保留1,048,576 token窗口,支持大型代码仓库整库理解
多模态输入:支持文本、图像、视频、音频、PDF输入,文本输出
驱动Muse Code:Meta首批终端编程智能体(beta),单命令安装于macOS/Linux
Terminal-Bench 2.1 82.9%:仅次于Claude Opus 5,编程体感接近全球领先水平
贡献者层级:反馈门控准入,定价约低12倍,面向活跃开发者社区
🎯 典型应用场景
大型代码仓库的端到端软件工程任务
多步骤工具调用与子智能体协调的长程编程
复杂调试、代码重构与跨文件依赖管理
终端编程智能体驱动的本地开发工作流
💪 技术优势与差异化
- 编程能力大幅跃升:Terminal-Bench 2.1从76.2%提升至82.9%,DeepSWE 1.1从53.0%提升至59.3%
- 1M上下文支持整库理解,适合企业级大型工程
- 定价与1.1持平,编程升级不增成本
- Muse Code终端集成,开发者本地一键启用
- 多模态输入可处理PDF设计文档与截图,编程场景覆盖更广
⚠️ 使用局限与注意事项
- 闭源专有模型,仅通过API提供服务,不支持本地部署或权重下载。
- 参数规模未公开,企业无法自行评估模型容量与边界。
- Terminal-Bench 2.1与DeepSWE 1.1均仅次于Claude Opus 5,并非位居前列。
- 贡献者层级需反馈门控准入,对不愿提供反馈的团队不适用。
- Muse Code为beta阶段,稳定性与生态成熟度仍在建设中。
👥 适用人群与企业
Meta Muse Spark 1.2主要面向:需要进行大型代码仓库重构与长程软件工程的后端工程师与技术负责人、希望以低成本批量进行代码评审的开发团队、以及需要结合设计文档进行意图校准的全栈开发者。通过云巴巴AI大模型广场可了解Meta Muse Spark 1.2的模型信息。
🏭 行业适配度评估
1M上下文整库理解+长程重构能力,直接命中大型互联网企业的遗留系统改造需求
⚠ 闭源API依赖,核心代码敏感企业需评估数据合规
复杂调试与代码评审能力可提升金融系统的代码质量与安全审计效率
⚠ 金融行业对数据驻留要求高,Meta合规细节未公开需核实
多模态输入可结合游戏设计PDF与代码,适合大型游戏项目的跨模块协作
⚠ 游戏项目代码量巨大,1M上下文仍有上限需分批处理
可辅助工业软件的代码维护与重构,但行业特定知识需额外微调
⚠ 制造业闭源部署偏好强,API模式接受度有限
编程能力可用于政务系统维护,但闭源与数据驻留问题限制采用
⚠ 政务行业普遍要求本地化部署,闭源API难以满足
🔧 技术架构解析
| 架构设计 | Meta超级智能实验室(MSL)研发,参数规模未公开。通过自改进训练循环(self-improvement training loop)与Muse Code协同训练,显著扩大编程任务训练算力并扩展训练环境多样性。 |
|---|---|
| 上下文机制 | 1,048,576 token原生上下文窗口,最大输出131,072 token,支持大型代码仓库整库输入。 |
| 多模态输入 | 支持文本、图像、视频、音频、PDF输入,文本输出,可结合设计文档与截图进行编程。 |
| 部署平台 | 通过Meta Model API与OpenRouter提供服务,Muse Code终端智能体可在macOS和Linux单命令安装。 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(Meta未明确说明Muse Spark系列是否使用用户API数据用于训练) |
|---|---|
| 合规认证 | 未公开 |
| 数据驻留 | 通过Meta Model API与OpenRouter提供服务,数据在Meta基础设施处理 |
| 加密方式 | 传输加密(TLS),存储加密标准未公开细节 |
⚔️ Muse Spark 1.2 与同梯队编程模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| Claude Opus 5 | Terminal-Bench 2.1 86.7%全球领先 | $5/$25定价是Muse Spark 1.2的4倍 |
| GPT-5.6 Terra | DeepSWE 1.1 64.8%略胜 | Meta内部编程基准65.4%落后Muse的70.6% |
| Muse Spark 1.1 | 定价相同 | Terminal-Bench 76.2%明显落后1.2的82.9% |
- Terminal-Bench 2.1 82.9%仅次于Claude Opus 5,编程体感接近全球领先水平
- 1M上下文支持大型代码仓库整库理解
- $1.25/$4.25定价与1.1持平,编程升级不增成本
- 贡献者层级0.10/0.20美元,约便宜12倍
🏢 同厂商模型矩阵
Meta旗下Muse系列及多模态模型定位矩阵(选取代表性模型)
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Meta Muse Spark 1.2当前 | 编程专用旗舰 | code | 1M上下文,$1.25/$4.25,Terminal-Bench 82.9% |
| Meta Muse Glimmer 30B | 开源本地Agent | multimodal | Apache 2.0,30B dense,24GB显存可跑 |
| Meta Muse Spark 1.1 | 上一代旗舰 | multimodal | 7月发布,AA智能指数53 |
| Meta Muse Spark | 初代旗舰 | multimodal | 4月发布,Meta闭源新品牌首作 |
🧭 选型决策指南
1M上下文+Terminal-Bench 82.9%专为长程软件工程设计
Muse Spark 1.2闭源仅API,同厂开源的Glimmer 30B可本地跑
反馈门控后0.10/0.20美元,比标准层便宜约12倍
Terminal-Bench与DeepSWE均仅次于Claude Opus 5,非位居前列
🏆 真实使用案例
📌 某互联网企业使用Muse Spark 1.2驱动Muse Code进行遗留系统重构
📌 某开发团队使用贡献者层级进行批量代码评审
💬 用户真实评价
Muse Code在终端里驱动Muse Spark 1.2做长程重构,跨文件依赖理解比上一代明显更稳,整库喂入后基本不需要分段提示。
Terminal-Bench 82.9%的体感名副其实,复杂调试任务一次通过率明显提升。贡献者层级价格很友好,但反馈门控需要团队投入精力。
1M上下文整库理解是真刚需,PDF设计文档结合代码生成很贴合需求。闭源只能走API是稀缺遗憾,希望未来有开源版本。
✅ 实践建议与使用技巧
💡 Prompt工程建议
整库喂入配合任务目标
将整个代码仓库一次性喂入后,明确给出任务目标(如'将X模块重构为微服务'),让模型自主规划跨文件改动。
结合PDF设计文档校准意图
将设计文档PDF与代码一同输入,模型可结合文档意图生成更贴合需求的实现,减少文本来回描述。
Muse Code终端委派长程任务
通过Muse Code在终端中委派长程任务,让模型自主迭代直至完成,期间可观察其工具调用过程。
🔄 替代方案分析
这些开源模型可在本地24-128GB显存运行,适合隐私敏感场景。
Claude Opus 5在Terminal-Bench与DeepSWE均领先Muse Spark 1.2。
这些开源模型编程能力强且可自托管,无API依赖。








首页 




