蚂蚁集团inclusionAI实验室发布并开源百灵系列首批原生多模态大模型Ling-3.0-flash-VL。模型基于Ling-3.0-flash的MoE架构拓展,总参数量124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口256K Token(开源模型社区模型卡标注最长支持1M Token)。核心创新是视觉反馈机制——将任务从一次性生成推进为观察→行动→验证→修正的持续闭环,使执行结果更接近真实可用、可验证的交付。模型引入任意分辨率视觉编码器与VideoRoPE时间编码,语言主干沿用42层混合架构,交替排列KDA与Gated MLA(比例5:1),在124B总参数下极大压缩算力开销。训练实践表明原生多模态联合训练不仅拓展了应用边界,也拉升了文本智能:在Artificial Analysis Intelligence Index v4.1.1评估中,Ling-3.0-flash-VL得分42,较纯文本版Ling-3.0-flash的38分提升4分。在Image-to-WebDev Arena官方评测中,模型以linthium代号参赛,图片转网页得分高于GPT-5.4。BF16与FP8权重已在开源模型社区和ModelScope开源,FP4和INT4版本计划近期发布。模型可通过SGLang和vLLM部署,Ling Studio提供在线体验。
📋 技术规格
| 厂商 | 蚂蚁百灵 |
|---|---|
| 模型分类 | 多模态理解 |
| 参数规模 | 124B(MoE,激活5.5B) |
| 上下文窗口 | 256K(HF卡标注1M) |
| 最大输出 | 未公开 |
| 知识截止 | 未公开 |
| API定价 | 输入: 开源免费(MIT协议),OpenRouter限时免费输出: 开源免费(MIT协议) |
⭐ 核心能力详解
124B参数MoE,单次激活5.5B,极低推理成本
256K上下文窗口(HF卡标注1M),支持长文档长视频
视觉反馈机制:观察→行动→验证→修正闭环
42层混合架构:KDA + Gated MLA(5:1)
任意分辨率视觉编码器 + VideoRoPE时间编码
MIT协议开源,BF16+FP8权重公开
🎯 典型应用场景
视觉反馈编程:从参考图到可运行网页,渲染比对自矫正
GUI Agent:跨工具任务执行(查数据→整理Excel→生成图表)
医疗报告辅助解读:跨文档关联与红黄绿灯风险展示
实时视觉交互:摄像头边看边聊,动植物/地标/文字识别
长视频高光剪辑:定位→截取→验证→修正逐段微调
💪 技术优势与差异化
- 视觉反馈闭环使Agent可边执行边观察并持续修正,交付结果更可靠
- 原生多模态训练反哺文本智能,AAII得分较纯文本版提升4分
- 124B总参数仅激活5.5B,推理速度138.8 tokens/s(同级别中较快)
- MIT协议开源,支持SGLang和vLLM部署,商用无限制
- 图片转网页Arena得分超越GPT-5.4
⚠️ 使用局限与注意事项
- 长尾场景感知推理与前沿模型仍有差距
- 长链路Agent执行稳定性有待提升
- 长程全栈编码能力与领先模型有差距
- Thinking模式默认开启,输出较长(160M输出Token vs 同级别中位数84M)
- 多模态benchmark仅以图片形式发布,缺少可引用的数值表
💰 价格分析与成本建议
Ling-3.0-flash-VL采用MIT协议开源,权重免费下载。商用无限制。在线体验通过Ling Studio免费使用。OpenRouter限时免费提供API调用。自部署仅需GPU硬件成本,FP8版本可在更少GPU上运行。
👥 适用人群与企业
前端开发者、AI Agent工程师、开源社区开发者、医疗信息化产品经理、长视频内容运营团队
🏭 行业适配度评估
视觉反馈编程和GUI Agent直接服务前端开发和自动化场景
⚠ Thinking模式默认开,输出Token消耗较高
跨文档医疗报告关联与风险展示能力突出
⚠ 仅供辅助参考,不能替代医生诊断,需医疗合规认证
实时学习伙伴可结合视频画面解释公式和示意图
⚠ 教育场景需关注内容安全过滤
长视频高光剪辑Agent可处理小时级视频
⚠ 体育视频剪辑需要专业知识辅助验证
GUI Agent可执行跨工具数据整理任务
⚠ 金融场景对结果准确性要求极高,需人工复核
🔧 技术架构解析
124B参数MoE架构,单次推理激活5.5B参数。视觉模块:任意分辨率ViT视觉编码器+两层投影器+VideoRoPE时间编码。语言主干:42层混合架构,交替排列KDA(Kimi Delta Attention)与Gated MLA(比例5:1)。Thinking模式默认开启,可按请求关闭。原生支持图文及视频多模态输入。MIT协议开源,BF16和FP8权重已在开源模型社区和ModelScope发布,FP4和INT4版本计划近期发布。可通过SGLang和Ling-tuned vLLM fork部署,附带推理与工具调用解析器。Ling Studio提供在线体验(chat.ant-ling.com)。
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(蚂蚁集团未明确说明训练数据来源) |
|---|---|
| 合规认证 | 中国算法备案、中国大模型服务备案 |
| 数据驻留 | 开源版本支持本地部署,数据不出域 |
| 加密方式 | 传输加密(TLS),存储加密 |
⚔️ 蚂蚁百灵Ling-3.0-flash-VL 与同厂商模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| Ling-3.0-flash(纯文本版) | 纯文本推理,AAII 38分 | 不支持视觉输入 |
| Ling-2.6-1T | 千亿参数规模 | 非多模态,参数更大成本更高 |
| Ring-1T | 推理专用 | 非多模态 |
| Qwen3.8-Flash | 同级别国产多模态,生态成熟 | 无视觉反馈闭环机制 |
- 视觉反馈闭环
- 原生多模态反哺文本智能
- MIT开源商用无限制
- 5.5B激活低成本
🏢 同厂商模型矩阵
蚂蚁集团百灵系列模型矩阵(选取代表性模型)
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| 蚂蚁百灵Ling-3.0-flash-VL当前 | 当前主力(多模态) | multimodal | 124B MoE,5.5B激活,视觉反馈闭环,MIT开源 |
| Ling-2.6-1T | 千亿参数 | chat | 1T参数规模大模型 |
| Ring-1T | 推理专用 | reasoning | 千亿参数推理模型 |
🧭 选型决策指南
观察→行动→验证→修正闭环,交付结果更可靠
Image-to-WebDev Arena得分高于GPT-5.4
MIT协议开源,BF16+FP8权重公开,SGLang/vLLM可部署
可使用Ling-3.0-flash纯文本版,AAII 38分(VL版42分但含视觉开销)
无官方API定价,目前通过Ling Studio免费体验或OpenRouter限时免费
🏆 真实使用案例
📌 某互联网企业前端开发自动化
📌 某医疗平台健康报告解读
💬 用户真实评价
视觉反馈编程很实用,给设计稿截图就能生成代码,还能自己渲染比对修正,省了很多来回调试的时间。
GUI Agent能力不错,跨工具任务执行时能边操作边校准。5.5B激活参数成本很低,适合多轮Agent工作流。
MIT协议太良心了,商用无限制。BF16和FP8都开了,vLLM部署文档也全。不过Thinking模式默认开有点费Token。
医疗报告解读的跨文档关联能力很惊艳,红黄绿灯展示很直观。当然只能做辅助参考,不能替代医生。
✅ 实践建议与使用技巧
💡 Prompt工程建议
设计视觉反馈工作流
不要让模型一次性生成最终结果,设计观察→行动→验证→修正的多轮流程。
GUI Agent拆步骤执行
跨工具任务拆成单步操作,每步执行后重新观察界面状态再决定下一步。
关闭Thinking模式省Token
非推理密集任务可按请求关闭Thinking模式,减少输出Token消耗约一半。
🔄 替代方案分析
这些模型有更成熟的API服务和企业级支持
闭源模型在长尾场景和复杂推理上更强
Ling-3.0-flash纯文本版参数更小,如不需视觉可用纯文本版
Ling-3.0-flash-VL是视频理解模型,非视频生成模型







首页 



