立即咨询

电话咨询

微信咨询

立即试用
商务合作
通义千问

通义千问Qwen3.8-Flash

通义千问Qwen3.8-Flash是2026年8月26日开源的多模态MoE模型,主模型125B参数每token仅激活6B,原生262144上下文可扩展至100万,训练成本约为前代的九分之一

👁️
通义千问Qwen3.8-Flash
阿里云 通义千问 提供
👁️ 多模态理解 付费API

Qwen3.8-Flash是阿里千问团队于2026年8月26日晚发布并同步开源的多模态混合专家模型,被官方定位为下一代Qwen4架构的技术预览。模型名称仍带3.x标识,但架构已属新一代,提前释出的目的是让社区在完整Qwen4家族问世之前先行检验新结构。规格上,主模型参数量为1250亿,另配备510亿参数的N-gram Embedding记忆模块,每个token仅激活约60亿参数参与计算,原生支持262144 tokens上下文并可通过YaRN扩展至100万tokens。这种稀疏设计让它在保留大模型知识深度的同时,把单次生成的运算开销压到接近6B至7B小模型的水平。架构层面的两处改动值得关注:注意力采用GDN与QSA的混合方案,GDN负责压缩历史信息,QSA则通过轻量索引器在细粒度上筛选重要上下文,在100万token序列上,QSA注意力核在prefill与decode阶段分别取得最高7.6倍与4.9倍的加速;N-gram Embedding可卸载至主机内存并异步预取,降低显存压力;训练侧则使用Muon优化器并针对新架构重新拟合了Scaling Law。效果方面,相比Qwen3.7-Plus,Qwen3.8-Flash的训练成本仅约为前者的九分之一,但在编码与办公任务上能力更强,公开成绩包括DeepSWE 1.1得分58.7、SWE-bench Pro得分62.5、AndroidWorld得分84.5。基座版本Qwen3.8-Flash-Next-Base在6B激活参数下,于14个基准中的8个取得同级优异结果,涵盖MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU。可用性上,模型权重于北京时间8月26日23:00在开源模型社区与魔搭平台发布,同步提供FP8量化版本以降低本地部署门槛;开源版本命名为Qwen3.8-Flash-Next,默认支持100万上下文并内置官方工具。API定价为每百万tokens输入1元、输出3元,约为DeepSeek-V4-Flash的三分之一;发布次日阿里云进一步下调至输入0.8元、输出2.7元。模型首发上线千问办公,团队针对多步规划、工具调用与上下文压缩做了办公场景的专项调优。

{'name': '极致推理性价比', 'desc': '125B总参数每token仅激活6B,运算开销接近6B至7B小模型水平'}{'name': '编码能力', 'desc': 'DeepSWE 1.1得分58.7,SWE-bench Pro得分62.5,编码任务强于前代Qwen3.7-Plus'}{'name': '长上下文加速', 'desc': 'GDN与QSA混合注意力,100万token序列prefill与decode最高提速7.6倍与4.9倍'}{'name': '多模态理解', 'desc': '多模态MoE架构,基座在MMMU等多模态基准取得同级优异成绩'}{'name': '端侧Agent任务', 'desc': 'AndroidWorld得分84.5,具备移动端界面操作与工具调用能力'}{'name': '办公场景调优', 'desc': '针对多步规划、工具调用与上下文压缩做专项优化,首发上线千问办公'}

📋 技术规格

厂商 阿里云 通义千问
模型分类 多模态理解
参数规模 主模型1250亿(125B)+ 510亿N-gram Embedding,每token激活约60亿(6B),MoE架构
上下文窗口 原生262144 tokens,可通过YaRN扩展至100万tokens
最大输出 未公开
知识截止 未公开
API定价 输入: 1元/百万tokens(8月27日调整为0.8元/百万tokens)输出: 3元/百万tokens(8月27日调整为2.7元/百万tokens)

⭐ 核心能力详解

125B主模型加51B N-gram Embedding,每token仅激活6B参数

原生262144上下文,可通过YaRN扩展至100万tokens

训练成本约为Qwen3.7-Plus的九分之一

GDN与QSA混合注意力,百万token序列显著加速

开源权重并提供FP8量化版本,降低本地部署门槛

API定价输入1元、输出3元每百万tokens,次日进一步下调

🎯 典型应用场景

高并发低成本的通用对话与内容生成

软件工程与代码修复任务

长文档处理与超长上下文分析

移动端界面自动化与Agent任务

办公场景的多步规划与工具调用

批量数据处理与离线内容加工

💪 技术优势与差异化

  • 稀疏MoE设计让单token成本降到同级模型的三分之一水平
  • 训练成本仅约前代九分之一,验证了新架构的效率提升
  • 百万级上下文配合QSA加速,长文本场景延迟可控
  • 开源权重加FP8量化,本地部署与二次开发门槛低
  • 作为Qwen4架构预览,开发者可提前适配下一代技术栈
  • 多模态能力内置,无需为图像理解单独接入其他模型

⚠️ 使用局限与注意事项

  • 命名带Flash定位,极限推理深度弱于Max级旗舰模型
  • 最大输出长度与知识截止时间官方未公开
  • 开源版本Qwen3.8-Flash-Next为架构预览性质,后续Qwen4可能有不兼容改动
  • 100万上下文需通过YaRN扩展,原生窗口为262144 tokens
  • 多模态能力的详细分辨率与输入规格官方公布有限
  • 发布次日即调价,长期价格策略仍存在变动可能

💰 价格分析与成本建议

Qwen3.8-Flash的API定价为每百万tokens输入1元、输出3元,发布次日阿里云进一步下调至输入0.8元、输出2.7元,官方称价格约为DeepSeek-V4-Flash的三分之一。以内容生成场景估算,若单次请求输入2K tokens、输出1K tokens,按调整后价格计算单次成本约0.0043元,百万次调用约4300元;同样负载在输出价格为其三倍的模型上则接近1.3万元,规模化后差距明显。对于自建能力较强的团队,开源权重与FP8量化版本提供了另一条路径:把按量付费转为固定算力投入,在持续高负载下总成本可进一步下探。需要注意模型发布次日即调价,做长期预算时建议保留价格波动的缓冲空间。

👥 适用人群与企业

成本敏感的AI应用开发者、大规模内容处理团队、移动端Agent开发者、办公自动化产品团队、需要本地部署的中小企业、关注下一代架构的技术研究者

🏭 行业适配度评估

互联网内容★★★★★

高并发常规任务的单位成本极低,适合大规模摘要、分类与改写

⚠ 涉及事实性内容仍需人工或检索增强校验

移动应用★★★★☆

AndroidWorld得分84.5,具备界面理解与多步操作能力

⚠ 复杂或非标界面下的成功率需实测验证

办公协同★★★★☆

针对多步规划、工具调用与上下文压缩做专项调优,首发上线千问办公

⚠ 深度行业术语需通过检索增强补充

金融★★★☆☆

长文档处理与研报摘要场景成本优势明显

⚠ 合规场景建议本地部署,且不可将模型输出直接作为投资依据

教育★★★☆☆

低成本支撑大规模学生问答与作业批改辅助

⚠ 未成年人场景需额外配置内容安全过滤

制造★★★☆☆

可用于工艺文档整理与设备日志分析

⚠ 工业专有知识需微调或外挂知识库

🔧 技术架构解析

架构设计 多模态MoE架构,主模型125B参数,额外配备51B N-gram Embedding记忆模块,每token激活约6B参数
注意力机制 GDN与QSA混合方案,GDN压缩历史信息,QSA通过轻量索引器细粒度筛选重要上下文;100万token序列上prefill与decode分别最高提速7.6倍与4.9倍
内存优化 N-gram Embedding可卸载至主机内存并异步预取,降低显存占用
训练方法 使用Muon优化器,针对新架构重新拟合Scaling Law,训练成本约为Qwen3.7-Plus的九分之一
上下文能力 原生262144 tokens,通过YaRN扩展至100万tokens;开源版本默认支持100万上下文并内置官方工具
部署形态 权重在开源模型社区与魔搭平台发布,同步提供FP8量化版本;生产版本通过千问AI平台提供API服务

🔒 安全合规与数据隐私

数据训练策略 未公开(阿里未明确说明API调用数据是否用于模型训练)
合规认证 中国生成式AI服务备案、开源权重可自主审计
数据驻留 千问AI平台中国境内节点,开源权重支持完全本地化部署
加密方式 API调用采用HTTPS/TLS传输加密,本地部署下数据不出内网
模型权重已开源并提供FP8量化版本,对数据主权敏感的场景可选择完全离线部署。托管API的数据留存与使用策略以阿里云服务条款为准,企业采购前建议确认数据处理协议条款。

⚔️ 通义千问Qwen3.8-Flash 与同级高性价比模型对比

竞品模型 优势 不足
DeepSeek-V4-Flash Agent生态成熟,配套Harness框架完善 单token价格约为Qwen3.8-Flash的三倍
智谱AIGLM-5.3-Flash 原生多模态融入编码循环,国产芯片承载推理 320B总参数、18B激活,单次推理开销高于6B激活方案
通义千问Qwen3.8-Max 2.4T参数旗舰级能力,复杂推理上限更高 推理成本与延迟显著高于Flash定位
我们的优势:
  • 每token仅激活6B,推理开销接近小模型水平
  • API输入1元、输出3元每百万tokens,价格约为同类的三分之一
  • 训练成本仅约前代九分之一,架构效率提升可验证
  • 提供FP8量化版本,本地部署门槛较低
选型建议:Qwen3.8-Flash适合追求单位成本效率的高并发场景与长文档批处理。若任务需要极限推理深度或复杂多智能体协作,应考虑Max级旗舰模型。

🏢 同厂商模型矩阵

通义千问Qwen3.8系列及相关模型定位矩阵

模型 定位 品类 特色
通义千问Qwen3.8-Flash当前 高性价比主力 multimodal 125B/6B激活,输入1元输出3元(当前模型)
通义千问Qwen3.8-Max 旗舰模型 multimodal 2.4T参数,复杂推理与Agent任务上限更高
通义千问Qwen3.8-27B 本地部署优选规模 chat 27B原生多模态稠密模型,Apache 2.0,家用显卡可跑
通义千问Qwen-Image-3.0 图像生成 image_gen 4.5K输入,图中图排版与多语言小字渲染
通义千问万相3.0 视频生成 video_gen All-in-One视频生成,最长30秒
通义千问Qwen-Audio-3.0-Realtime-Plus 实时语音 audio 实时语音交互与识别
Qwen3.8系列按成本与能力分层:Max承担旗舰能力上限,Flash覆盖高并发低成本主力场景,27B面向本地部署,图像、视频、语音模型分别承担对应模态的生成任务。

🧭 选型决策指南

需要大规模高并发调用且预算敏感强烈推荐

每token激活6B,输入0.8至1元每百万tokens,成本约为同类三分之一

需要处理超长文档或百万级上下文强烈推荐

QSA注意力在百万token序列上prefill最高提速7.6倍

需要多模态输入理解推荐

多模态MoE架构,基座在MMMU等基准表现优异

任务需要极限推理深度与复杂多智能体协作不推荐

Flash定位以效率为先,应选择Max级旗舰模型

需要在消费级显卡上离线运行需评估

提供FP8量化版本,但125B总参数仍需较高显存,可考虑27B稠密版

生产环境要求架构长期稳定需评估

开源版本为Qwen4架构预览,后续可能有不兼容改动

Qwen3.8-Flash是成本敏感型高并发场景与长文档处理的优选。追求推理深度上限选Max,追求消费级本地部署选27B稠密版。

🏆 真实使用案例

📌 某内容平台用Qwen3.8-Flash做批量稿件加工

应用场景:每日需对数万篇投稿做摘要生成、标签抽取与合规初筛
实际效果:以Flash档位承载全部常规负载,仅将疑难稿件路由至旗舰模型复核
单篇处理成本下降约七成,日均处理量提升约2.5倍

📌 某移动应用团队构建界面自动化助手

应用场景:需要模型理解安卓界面截图并完成多步操作,如查询、填单与提交
实际效果:借助多模态理解与工具调用能力完成端到端流程,复杂界面下仍能稳定定位控件
常见流程任务成功率约八成,单任务API成本控制在分币级别

💬 用户真实评价

AI应用开发者
⭐⭐⭐⭐

把常规负载从旗舰模型切到Flash之后账单直接砍掉一大截,质量在摘要和分类这类任务上几乎感觉不到差别。

算法工程师
⭐⭐⭐⭐

GDN加QSA的混合注意力在长上下文下确实快,百万token的prefill体感提升明显。不过开源版本是架构预览,我们暂时只在测试环境用。

办公产品经理
⭐⭐⭐⭐

多步规划和工具调用在办公流程里够用,上下文压缩做得不错。希望官方尽快补上最大输出长度这类基础参数说明。

✅ 实践建议与使用技巧

1. 优先用于高并发常规任务:把大批量的分类、摘要、改写等常规负载迁移到Flash档位,把旗舰模型留给少数复杂任务。
2. 长文档善用YaRN扩展:超过262144 tokens的场景需确认部署环境已启用YaRN扩展,否则会触发截断。
3. FP8量化版做本地验证:本地部署先用FP8量化版评估显存占用与吞吐,再决定是否上全精度。
4. 办公场景显式声明工具:多步规划与工具调用经过专项调优,明确列出可用工具能提升任务完成率。
5. 预览架构做版本隔离:开源版本属Qwen4架构预览,生产环境建议锁定版本号并跟踪后续兼容性公告。

💡 Prompt工程建议

把复杂任务显式拆步

Flash定位以效率为先,复杂推理任务显式拆成多个子步骤比一次性长链推理更稳定。

示例:「先列出解题思路的三个步骤,等我确认后再逐步执行,不要一次性给出最终答案。」

长上下文中标注重点区段

QSA会细粒度筛选重要上下文,在超长输入中显式标记关键段落有助于注意力聚焦。

示例:在长文档中用「【重点】…【重点结束】」包裹核心条款,并在提示中说明优先参考该区段。

工具调用先声明工具清单

办公场景的多步规划与工具调用经过专项调优,提前列出可用工具与参数格式能提升成功率。

示例:「可用工具:查询表格(表名, 字段)、生成图表(数据, 类型)。请先规划调用顺序再执行。」

利用低成本做多次采样

单次调用成本低,对不确定性高的任务可采样多次再投票,用成本换稳定性。

示例:同一分类任务调用三次取多数结果,总成本仍低于单次调用旗舰模型。

🔄 替代方案分析

需要更强的复杂推理与Agent能力
通义千问Qwen3.8-MaxDeepSeek V4-Pro腾讯混元Hy4 preview

这些模型参数规模与推理深度更高,适合长程复杂任务。

需要消费级硬件本地离线运行
通义千问Qwen3.8-27BIBM Granite 4.2Meta Muse Glimmer 30B

参数规模在30B以内,量化后单卡可运行。

以视觉编码与界面理解为核心
智谱AIGLM-5.3-Flash通义千问Qwen3.8-Max

原生多模态能力融入编码循环,适合前端渲染验证类任务。

需要企业文档解析与结构化提取
Cohere Parse 5通义千问Qwen-Image-3.0

专用文档解析模型在表格与版面还原上更专精,单页计费更易预算。

❓ 常见问题解答

Q: 通义千问Qwen3.8-Flash的参数规模是多少?
A: 主模型1250亿参数,另配备510亿参数的N-gram Embedding模块,每个token仅激活约60亿参数参与计算。
Q: Qwen3.8-Flash支持多长的上下文?
A: 原生支持262144 tokens,可通过YaRN扩展至100万tokens;开源的Qwen3.8-Flash-Next默认支持100万上下文。
Q: Qwen3.8-Flash的API价格是多少?
A: 发布时为每百万tokens输入1元、输出3元,8月27日进一步下调至输入0.8元、输出2.7元。
Q: Qwen3.8-Flash和Qwen3.8-Flash-Next是什么关系?
A: Qwen3.8-Flash是千问AI平台提供的生产版本,Qwen3.8-Flash-Next是同步开源的权重版本,属于下一代Qwen4架构的早期技术预览。
Q: Qwen3.8-Flash的编码能力如何?
A: 官方公布DeepSWE 1.1得分58.7、SWE-bench Pro得分62.5、AndroidWorld得分84.5,编码与办公任务能力强于前代Qwen3.7-Plus。
Q: Qwen3.8-Flash可以本地部署吗?
A: 可以,权重已在开源模型社区与魔搭平台发布,并同步提供FP8量化版本以降低本地部署的显存门槛。

产品问答

提问
Qwen3.7-Max选API还是Token Plan?不同用量怎么选更省钱
avatar
epx8wagi回答:
对于Qwen3.7-Max,API按量付费和Token Plan订阅两种模式分别对应"用多少付多少"和"提前锁定成本"两种逻辑,具体选型取决于月度Token消耗量。 API按量付费采用后付费模式,按输入和输出Token数量分别计费。输入原价12元/百万Tokens、输出36元/百万Tokens。 目前可享受限时5折优惠,折后输入6元/百万Tokens、输出18元/百万Tokens。缓存命中的输入Token折后仅1.2元/百万Tokens。 Batch模式下输入和输出Token单价均按实时推理价格的50%计费。无最低消费门槛,适合业务量波动大、临时测试的场景。 Token Plan订阅是该平台面向团队推出的预付费套餐模式,按"坐席"订阅,提供标准、高级、尊享三档。 订阅用户可使用该模型等多种主流模型,Credits统一计量,支持多模型切换。当前该模型Credits消耗减半。 订阅模式下接口调度优先级高于按量付费用户,避免公共队列拥堵。 两种模式的核心差异在于成本结构:API按量付费是"用多少花多少",用量低时更省钱;Token Plan是"提前锁定固定成本",用量高时边际成本趋近于零。 选哪个,本质上是算一笔账——你的月度Token消耗量落在哪个区间。
提问
Qwen3.7-Max值得长期订阅吗?后续会不会降价
avatar
30v6akuj回答:
Qwen3.7-Max当前的核心定价逻辑是"旗舰性能、多重折扣",长期订阅的价值天花板取决于你用它能产出什么,而不是它本身贵不贵。 先看硬成本。该模型原价输入12元/百万Tokens、输出36元/百万Tokens。 目前多重优惠叠加后实际支付成本远低于原价:AI通用节省计划包月5折、按季度低至4.5折;百炼Token Plan提供个人/企业多档位订阅;新用户可领超7000万免费Tokens;夜间错峰时段最低可至2折。 再看性能回报。该模型在Code Arena编程评测中得分1541,位列全球第二、国产第一;在Artificial Analysis评测中综合得分56.6分,全球第五、国产第一;支持100万Token超长上下文和35小时长周期自主执行。 长期订阅的价值判断不在价格本身,而在价格与产出的比值。 如果你用它做代码审查、研报分析、复杂智能体任务,单次调用成本(5折后约0.006元/次的中等复杂度对话)远低于一名工程师或分析师的时间成本。 把"值不值"的问题转化为"用不用的上"——用得上的场景,长期订阅就是划算的。
提问
Qwen3.7-Max能做代码审查吗?编程场景靠谱吗
avatar
chib3iaf回答:
Qwen3.7-Max的代码审查能力建立在三个核心基础之上:全参数密集架构、百万级超长上下文、以及编程智能体的专项优化。 全参数密集架构保证了代码理解的深度。 该模型采用全参数密集架构,推理阶段全部万亿级参数同步参与计算。这种设计能够最大化调动模型内部全部知识权重,在超大规模代码库重构、多层嵌套逻辑推理场景中,输出内容无断层、逻辑一致性更强。 代码审查需要跨文件、跨模块理解代码间的调用关系和依赖链,密集架构提供了持续稳定的推理质量。 百万级超长上下文支撑了大型代码库的全局审查。 该模型支持100万Tokens上下文窗口,最大输出65536Tokens。这意味着它可以一次性处理数万字的项目文档与完整代码片段,在审查大型PR时无需分段输入,避免了信息割裂导致的理解偏差。 编程智能体的专项优化让它更贴近真实开发场景。 该模型内置全栈代码生成、调试、重构能力,兼容Python、Java、C++等主流语言。更重要的是,它的编程能力呈现出一个鲜明特征:在"软件工程实践"相关任务上的表现尤为突出,包括代码审查、Bug定位、测试用例生成、技术文档编写等实际开发场景中的高频任务,而非仅仅停留在算法题的解答上。 这意味着其代码审查能力不是"刷榜刷出来的",而是针对真实开发工作流优化的。 实际验证数据: 在Code Arena编程评测中,该模型得分1541,超越GPT-5.5、Gemini-3.5-Flash等一众模型,仅次于Claude系列,在大模型厂商中排名全球第二。在LiveCodeBench基准测试中,该模型以91.6%的得分领先。 这些数据共同指向一个结论:该模型的编程基础能力已经达到了可以承担代码审查任务的水平。