Qwen3.8-Flash是阿里千问团队于2026年8月26日晚发布并同步开源的多模态混合专家模型,被官方定位为下一代Qwen4架构的技术预览。模型名称仍带3.x标识,但架构已属新一代,提前释出的目的是让社区在完整Qwen4家族问世之前先行检验新结构。规格上,主模型参数量为1250亿,另配备510亿参数的N-gram Embedding记忆模块,每个token仅激活约60亿参数参与计算,原生支持262144 tokens上下文并可通过YaRN扩展至100万tokens。这种稀疏设计让它在保留大模型知识深度的同时,把单次生成的运算开销压到接近6B至7B小模型的水平。架构层面的两处改动值得关注:注意力采用GDN与QSA的混合方案,GDN负责压缩历史信息,QSA则通过轻量索引器在细粒度上筛选重要上下文,在100万token序列上,QSA注意力核在prefill与decode阶段分别取得最高7.6倍与4.9倍的加速;N-gram Embedding可卸载至主机内存并异步预取,降低显存压力;训练侧则使用Muon优化器并针对新架构重新拟合了Scaling Law。效果方面,相比Qwen3.7-Plus,Qwen3.8-Flash的训练成本仅约为前者的九分之一,但在编码与办公任务上能力更强,公开成绩包括DeepSWE 1.1得分58.7、SWE-bench Pro得分62.5、AndroidWorld得分84.5。基座版本Qwen3.8-Flash-Next-Base在6B激活参数下,于14个基准中的8个取得同级优异结果,涵盖MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU。可用性上,模型权重于北京时间8月26日23:00在开源模型社区与魔搭平台发布,同步提供FP8量化版本以降低本地部署门槛;开源版本命名为Qwen3.8-Flash-Next,默认支持100万上下文并内置官方工具。API定价为每百万tokens输入1元、输出3元,约为DeepSeek-V4-Flash的三分之一;发布次日阿里云进一步下调至输入0.8元、输出2.7元。模型首发上线千问办公,团队针对多步规划、工具调用与上下文压缩做了办公场景的专项调优。
📋 技术规格
| 厂商 | 阿里云 通义千问 |
|---|---|
| 模型分类 | 多模态理解 |
| 参数规模 | 主模型1250亿(125B)+ 510亿N-gram Embedding,每token激活约60亿(6B),MoE架构 |
| 上下文窗口 | 原生262144 tokens,可通过YaRN扩展至100万tokens |
| 最大输出 | 未公开 |
| 知识截止 | 未公开 |
| API定价 | 输入: 1元/百万tokens(8月27日调整为0.8元/百万tokens)输出: 3元/百万tokens(8月27日调整为2.7元/百万tokens) |
⭐ 核心能力详解
125B主模型加51B N-gram Embedding,每token仅激活6B参数
原生262144上下文,可通过YaRN扩展至100万tokens
训练成本约为Qwen3.7-Plus的九分之一
GDN与QSA混合注意力,百万token序列显著加速
开源权重并提供FP8量化版本,降低本地部署门槛
API定价输入1元、输出3元每百万tokens,次日进一步下调
🎯 典型应用场景
高并发低成本的通用对话与内容生成
软件工程与代码修复任务
长文档处理与超长上下文分析
移动端界面自动化与Agent任务
办公场景的多步规划与工具调用
批量数据处理与离线内容加工
💪 技术优势与差异化
- 稀疏MoE设计让单token成本降到同级模型的三分之一水平
- 训练成本仅约前代九分之一,验证了新架构的效率提升
- 百万级上下文配合QSA加速,长文本场景延迟可控
- 开源权重加FP8量化,本地部署与二次开发门槛低
- 作为Qwen4架构预览,开发者可提前适配下一代技术栈
- 多模态能力内置,无需为图像理解单独接入其他模型
⚠️ 使用局限与注意事项
- 命名带Flash定位,极限推理深度弱于Max级旗舰模型
- 最大输出长度与知识截止时间官方未公开
- 开源版本Qwen3.8-Flash-Next为架构预览性质,后续Qwen4可能有不兼容改动
- 100万上下文需通过YaRN扩展,原生窗口为262144 tokens
- 多模态能力的详细分辨率与输入规格官方公布有限
- 发布次日即调价,长期价格策略仍存在变动可能
💰 价格分析与成本建议
Qwen3.8-Flash的API定价为每百万tokens输入1元、输出3元,发布次日阿里云进一步下调至输入0.8元、输出2.7元,官方称价格约为DeepSeek-V4-Flash的三分之一。以内容生成场景估算,若单次请求输入2K tokens、输出1K tokens,按调整后价格计算单次成本约0.0043元,百万次调用约4300元;同样负载在输出价格为其三倍的模型上则接近1.3万元,规模化后差距明显。对于自建能力较强的团队,开源权重与FP8量化版本提供了另一条路径:把按量付费转为固定算力投入,在持续高负载下总成本可进一步下探。需要注意模型发布次日即调价,做长期预算时建议保留价格波动的缓冲空间。
👥 适用人群与企业
成本敏感的AI应用开发者、大规模内容处理团队、移动端Agent开发者、办公自动化产品团队、需要本地部署的中小企业、关注下一代架构的技术研究者
🏭 行业适配度评估
高并发常规任务的单位成本极低,适合大规模摘要、分类与改写
⚠ 涉及事实性内容仍需人工或检索增强校验
AndroidWorld得分84.5,具备界面理解与多步操作能力
⚠ 复杂或非标界面下的成功率需实测验证
针对多步规划、工具调用与上下文压缩做专项调优,首发上线千问办公
⚠ 深度行业术语需通过检索增强补充
长文档处理与研报摘要场景成本优势明显
⚠ 合规场景建议本地部署,且不可将模型输出直接作为投资依据
低成本支撑大规模学生问答与作业批改辅助
⚠ 未成年人场景需额外配置内容安全过滤
可用于工艺文档整理与设备日志分析
⚠ 工业专有知识需微调或外挂知识库
🔧 技术架构解析
| 架构设计 | 多模态MoE架构,主模型125B参数,额外配备51B N-gram Embedding记忆模块,每token激活约6B参数 |
|---|---|
| 注意力机制 | GDN与QSA混合方案,GDN压缩历史信息,QSA通过轻量索引器细粒度筛选重要上下文;100万token序列上prefill与decode分别最高提速7.6倍与4.9倍 |
| 内存优化 | N-gram Embedding可卸载至主机内存并异步预取,降低显存占用 |
| 训练方法 | 使用Muon优化器,针对新架构重新拟合Scaling Law,训练成本约为Qwen3.7-Plus的九分之一 |
| 上下文能力 | 原生262144 tokens,通过YaRN扩展至100万tokens;开源版本默认支持100万上下文并内置官方工具 |
| 部署形态 | 权重在开源模型社区与魔搭平台发布,同步提供FP8量化版本;生产版本通过千问AI平台提供API服务 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(阿里未明确说明API调用数据是否用于模型训练) |
|---|---|
| 合规认证 | 中国生成式AI服务备案、开源权重可自主审计 |
| 数据驻留 | 千问AI平台中国境内节点,开源权重支持完全本地化部署 |
| 加密方式 | API调用采用HTTPS/TLS传输加密,本地部署下数据不出内网 |
⚔️ 通义千问Qwen3.8-Flash 与同级高性价比模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| DeepSeek-V4-Flash | Agent生态成熟,配套Harness框架完善 | 单token价格约为Qwen3.8-Flash的三倍 |
| 智谱AIGLM-5.3-Flash | 原生多模态融入编码循环,国产芯片承载推理 | 320B总参数、18B激活,单次推理开销高于6B激活方案 |
| 通义千问Qwen3.8-Max | 2.4T参数旗舰级能力,复杂推理上限更高 | 推理成本与延迟显著高于Flash定位 |
- 每token仅激活6B,推理开销接近小模型水平
- API输入1元、输出3元每百万tokens,价格约为同类的三分之一
- 训练成本仅约前代九分之一,架构效率提升可验证
- 提供FP8量化版本,本地部署门槛较低
🏢 同厂商模型矩阵
通义千问Qwen3.8系列及相关模型定位矩阵
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| 通义千问Qwen3.8-Flash当前 | 高性价比主力 | multimodal | 125B/6B激活,输入1元输出3元(当前模型) |
| 通义千问Qwen3.8-Max | 旗舰模型 | multimodal | 2.4T参数,复杂推理与Agent任务上限更高 |
| 通义千问Qwen3.8-27B | 本地部署优选规模 | chat | 27B原生多模态稠密模型,Apache 2.0,家用显卡可跑 |
| 通义千问Qwen-Image-3.0 | 图像生成 | image_gen | 4.5K输入,图中图排版与多语言小字渲染 |
| 通义千问万相3.0 | 视频生成 | video_gen | All-in-One视频生成,最长30秒 |
| 通义千问Qwen-Audio-3.0-Realtime-Plus | 实时语音 | audio | 实时语音交互与识别 |
🧭 选型决策指南
每token激活6B,输入0.8至1元每百万tokens,成本约为同类三分之一
QSA注意力在百万token序列上prefill最高提速7.6倍
多模态MoE架构,基座在MMMU等基准表现优异
Flash定位以效率为先,应选择Max级旗舰模型
提供FP8量化版本,但125B总参数仍需较高显存,可考虑27B稠密版
开源版本为Qwen4架构预览,后续可能有不兼容改动
🏆 真实使用案例
📌 某内容平台用Qwen3.8-Flash做批量稿件加工
📌 某移动应用团队构建界面自动化助手
💬 用户真实评价
把常规负载从旗舰模型切到Flash之后账单直接砍掉一大截,质量在摘要和分类这类任务上几乎感觉不到差别。
GDN加QSA的混合注意力在长上下文下确实快,百万token的prefill体感提升明显。不过开源版本是架构预览,我们暂时只在测试环境用。
多步规划和工具调用在办公流程里够用,上下文压缩做得不错。希望官方尽快补上最大输出长度这类基础参数说明。
✅ 实践建议与使用技巧
💡 Prompt工程建议
把复杂任务显式拆步
Flash定位以效率为先,复杂推理任务显式拆成多个子步骤比一次性长链推理更稳定。
长上下文中标注重点区段
QSA会细粒度筛选重要上下文,在超长输入中显式标记关键段落有助于注意力聚焦。
工具调用先声明工具清单
办公场景的多步规划与工具调用经过专项调优,提前列出可用工具与参数格式能提升成功率。
利用低成本做多次采样
单次调用成本低,对不确定性高的任务可采样多次再投票,用成本换稳定性。
🔄 替代方案分析
这些模型参数规模与推理深度更高,适合长程复杂任务。
参数规模在30B以内,量化后单卡可运行。
原生多模态能力融入编码循环,适合前端渲染验证类任务。
专用文档解析模型在表格与版面还原上更专精,单页计费更易预算。








首页 

2026-08-28


3个回答 

