Muse Glimmer 30B是Meta超级智能实验室(MSL)于2026年8月10日发布并开源的多模态Agent模型,标志着Meta在春季退役Llama开源线、转向闭源Muse Spark后,重新回归开源——而且是Meta历史上首次采用纯Apache 2.0协议(无Llama式的MAU条款)。模型从闭源旗舰Muse Spark蒸馏至30B参数,采用dense架构:2B ViT风格视觉编码器(基于Perception Encoder)+ 28B文本解码器,共52层混合注意力(3层滑动窗口+1层全注意力交替)。Muse Glimmer专为本地常驻Agent工作流深度优化,覆盖多步推理、可靠工具调用、图文多模态理解与失败重试恢复,兼容OpenClaw、Hermes Agent等编排框架。4bit量化后权重压缩至20GB以内,可在24GB/32GB显存的Mac(M4/M5 Max)或单卡RTX 5090上本地运行,所有计算100%本地完成。基准上SWE-Bench Verified 76.0%、DeepSearch QA 74.6%、GPQA Diamond 83.5%、AIME 2026 94.7%、MCP Atlas 75.5%、OSWorld-Verified 65.9%,同尺寸优于Gemma4-31B与Qwen3.6-27B,并在多模态与数学工作上领先同侪。模型获transformers、llama.cpp、vLLM、MLX、ExecuTorch的Day-0支持,M5 Max速度26.6 tok/s(启用DFlash推测解码达50.2 tok/s)。在LLMCheck指数进入67分,排名第8,是32GB Mac上可运行的优质多模态模型。
📋 技术规格
| 厂商 | Meta AI |
|---|---|
| 模型分类 | 多模态理解 |
| 参数规模 | 30B dense(2B视觉编码器 + 28B文本解码器) |
| 上下文窗口 | 262,144 tokens原生,YaRN RoPE可扩展至1M |
| 最大输出 | 未公开 |
⭐ 核心能力详解
Apache 2.0纯开源:Meta首次无MAU条款的开源协议,可商用
30B dense多模态:2B视觉编码器+28B文本解码器,从Muse Spark蒸馏
本地常驻Agent:专为本地Agent工作流优化,支持多步推理与失败重试
24GB显存可跑:4bit量化后20GB以内,Mac M4/M5 Max或单卡RTX 5090可用
同尺寸领先:SWE-Bench Verified 76.0%、GPQA 83.5%、AIME 94.7%优于Gemma4-31B与Qwen3.6-27B
Day-0生态支持:transformers/llama.cpp/vLLM/MLX/ExecuTorch首发支持
🎯 典型应用场景
隐私敏感的本地Agent工作流(代码、文档分析、个人助手)
OpenClaw/Hermes Agent等编排框架的本地部署
24-32GB显存Mac或单卡工作站的常驻AI员工
图文多模态理解与屏幕截图解析的本地任务
💪 技术优势与差异化
- 纯Apache 2.0开源可商用,无MAU限制,企业可自由部署
- 30B尺寸在24GB显存即可跑,本地部署门槛低
- 多模态与数学工作同尺寸领先,SWE-Bench Verified 76.0%
- DFlash推测解码提速近2倍,M5 Max达50.2 tok/s
- Meta生态Day-0支持,主流推理框架兼容
⚠️ 使用局限与注意事项
- 30B尺寸在软件工程基准(SWE-Bench Verified 76.0%)仍略落后Qwen3.6-27B(77.2%)与Terminal-Bench(60.7% vs Qwen 60.7)。
- 默认思考模式偏长,延迟敏感场景需手动配置reasoning_effort参数。
- 仅文本输出,不支持图像/视频生成(输入多模态,输出纯文本)。
- dense架构30B参数,比同能力MoE模型显存占用更高。
- DFlash drafter需额外显存,24GB显存机器需权衡是否启用。
👥 适用人群与企业
Meta Muse Glimmer 30B主要面向:需要在24-32GB显存Mac或单卡工作站本地部署AI Agent的独立开发者与律所/医疗等隐私敏感行业、希望零API成本长期使用多模态AI助手的用户、以及使用OpenClaw或Hermes Agent编排框架构建本地Agent工作流的工程师。通过云巴巴AI大模型广场可了解Meta Muse Glimmer 30B的模型信息。
🏭 行业适配度评估
本地部署+多模态PDF解析,合同审查数据不出律所内网,完美匹配保密要求
⚠ 30B尺寸对超大型合同集仍需分批处理
病历与医学影像本地处理,满足HIPAA等数据驻留要求
⚠ 医学专业术语需额外微调提升准确率
敏感交易数据与研报本地分析,避免云端合规风险
⚠ 金融高频交易场景30B尺寸延迟偏高
工厂内网部署SOP解析与设备文档问答,数据不出厂区
⚠ 工业现场算力有限,24GB显存配置需评估
政务内网本地部署满足数据保密要求,Apache 2.0无商用限制
⚠ 政务系统对国产化有要求,Meta模型需评估合规
🔧 技术架构解析
| 架构设计 | 30B dense架构:2B ViT风格视觉编码器(基于Perception Encoder)+ 28B文本解码器,共52层。混合注意力:3层滑动窗口(2048 token,RoPE)+ 1层全注意力(NoPE)交替,重复13次。Gated GQA每16个query头共享1个KV头,KV cache内存降16倍。Q-K归一化+额外query缩放保持注意力稳定。 |
|---|---|
| 视觉编码器 | 2B ViT风格Perception Encoder,patchify为2帧x3通道x14x14,50层GELU MLP,3层窗口注意力+1层全注意力,2D RoPE。pixel shuffle 2x2合并降图像token 4倍。视频按2fps采样,上限96帧。 |
| 上下文机制 | 原生262,144 token上下文,通过YaRN RoPE缩放可扩展至1M(vLLM/SGLang支持)。 |
| 推测解码 | 可选DFlash drafter,结构化内容生成(如代码)提速近2倍。 |
| 部署生态 | transformers/llama.cpp/vLLM/MLX/ExecuTorch Day-0支持,4bit量化后20GB以内。 |
🔒 安全合规与数据隐私
| 数据训练策略 | Apache 2.0开源,本地部署时数据100%不出企业,无训练数据回流风险 |
|---|---|
| 合规认证 | Apache 2.0(开源可商用)、本地部署满足GDPR/数据驻留要求 |
| 数据驻留 | 本地部署数据100%留在企业内网,无云端传输 |
| 加密方式 | 部署方自行控制加密方案,模型本身不涉及传输加密 |
⚔️ Muse Glimmer 30B 与同尺寸开源多模态模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| Qwen3.6-27B | SWE-Bench Verified 77.2%略胜 | 多模态与数学工作落后Glimmer |
| Gemma4-31B | GPQA Diamond 85.7%略高 | SWE-Bench 66.6%明显落后,Gemma协议限制多 |
| Muse Spark 1.2 | 云端编程能力更强 | 闭源仅API,不支持本地部署 |
- 纯Apache 2.0开源可商用,无MAU限制
- 30B尺寸24GB显存即可跑,本地部署门槛低
- 多模态与数学工作同尺寸领先,AIME 2026 94.7%
- DFlash推测解码提速近2倍
🏢 同厂商模型矩阵
Meta旗下Muse系列及多模态模型定位矩阵(选取代表性模型)
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Meta Muse Glimmer 30B当前 | 开源本地Agent | multimodal | Apache 2.0,30B dense,24GB显存可跑 |
| Meta Muse Spark 1.2 | 闭源编程旗舰 | code | 1M上下文,$1.25/$4.25,Terminal-Bench 82.9% |
| Meta Muse Spark 1.1 | 上一代旗舰 | multimodal | 7月发布,AA智能指数53 |
| Meta Muse Spark | 初代旗舰 | multimodal | 4月发布,Meta闭源新品牌首作 |
🧭 选型决策指南
Apache 2.0开源,24GB显存可跑,数据100%本地
Glimmer 30B为本地Agent优化,云端编程选闭源1.2
LLMCheck排名第8,32GB Mac优质多模态
SWE-Bench 76.0%略落后Qwen3.6-27B 77.2%
🏆 真实使用案例
📌 某律所使用Muse Glimmer 30B本地部署进行合同审查
📌 某独立开发者使用Muse Glimmer构建本地编程助手
💬 用户真实评价
在M5 Max Mac上跑4bit量化版很流畅,26.6 tok/s够用,DFlash开启后近2倍提速。本地常驻Agent工作流正是我需要的。
Apache 2.0无MAU限制对我们很重要,敏感合同本地处理数据不出律所。多模态直接吃扫描版PDF省了OCR环节。
SWE-Bench 76%在同尺寸里很强,但软件工程基准仍落后Qwen3.6-27B的77.2%一点。默认思考偏长需手动调reasoning_effort。
✅ 实践建议与使用技巧
💡 Prompt工程建议
显式设置reasoning_effort
默认思考模式偏长,延迟敏感场景在请求中显式设置reasoning_effort参数控制思考深度。
多模态PDF直接喂入
利用原生多模态能力,将PDF文档与截图直接喂入,无需OCR中转,模型可直接理解图文混排。
DFlash提速代码生成
代码等结构化内容生成场景启用DFlash推测解码drafter,速度提升近2倍,权衡少量显存。
🔄 替代方案分析
Qwen3.6-27B的SWE-Bench Verified 77.2%略领先Glimmer,且同为开源可本地部署。
闭源云端旗舰编程能力更强,Terminal-Bench更高,适合不接受本地部署限制的场景。
若24GB显存仍偏高,这些2-7B模型可在更小显存运行,但能力相应下降。








首页 




