
DeepSeek V4 Flash 测评:企业落地要看这几点
基本情况
300b 这个尺寸,各家团队给出的上限判断并不一样。MiniMax 率先交卷,认为 300b 只能满足日常轻度需求;混元则认为它足以承担大部分不算复杂的工程任务;OpenAI 把小尺寸 Luna 交给 AI 自迭代训练当试验田,结果还不尽如人意。DeepSeek 的态度更激进,认为 300b 远没到极限,既能做高智力推理,也能撑起复杂开发。
从推理看,新 Flash 的极限打平自家的 1.6T Pro preview,稳定性还反超了。代价是 Token 消耗涨了 50%,这是后训练要付的账。Agentic 编程能力则完全超过 Pro preview,基本摸到了高可用区间的下限。
编程 Agent

测试方式参见:大模型编程应用测试-V3榜单。
Flash 的编程表现差异很大,差异同时来自语言方向和 Harness 两类。前端这类训练语料和方法更成熟的领域,效果明显更好,成品可以跟参数大近 3 倍的 GLM-5.2 打平。但到了 Rust、Swift 这些非热门领域,效果断崖式下跌,Flash 大体知道要做什么,细节掌握度还是不如前端。对比之下,Pro/Flash preview 版本连该做什么、怎么推进都不太清楚。
Harness 差异主要在 Claude Code 和 Codex 的默认设置与工具链不同。Claude Code 默认的单次输出长度限制了 Flash 的发挥。Flash 和之前的 preview 一样,喜欢动手前先想清楚,复杂项目规划阶段一次思考可能到 50K Token。Codex 因为自身迭代频繁,Flash 对其中工具的使用效率偏低,同样任务可能多花 30% 到 40% 的步数。不过最终效果看,两种 Harness 差别不大。即将发布的自家 Harness 能同时解决默认配置和工具熟悉两个问题,至少不在这方面拖后腿。
视觉方面,Flash 依然没有视觉能力,但前端审美比前代 preview 高了不少。之前 preview 直出 UI 是 Demo 级,进不了生产环境;正式版的 UI 精度、配色、尺寸、交互细节基本到了准生产级,甚至会主动加转场、icon 动效这类小设计,这在部分更高阶模型里也不多见。需要说明的是,Flash 的 UI 能力仍弱于第一梯队头部模型,尤其 web 端以外的 UI 构建。涉及建模、动画场景,Flash 劣势明显,露出训练不充分的状态,而这恰恰是大尺寸前沿模型的强项。
Flash 的自测和验证手段很丰富。除了传统测试用例,它还会把截图转成 ASCII 字符图来间接理解画面状态,也会写自动化序列操作去复现复杂动画场景,再读逐帧状态数值判断动画有没有问题。这些手段大多有效,比如 F 项目 Godot 场景里,Flash 靠自测发现并修掉了几乎所有功能 Bug,剩下主要是交互和性能问题。
推理能力上,和 Pro preview 比,Flash 做不到完胜。它的优势主要来自编程和写作训练泛化出的元能力,比如指令遵循和文字处理。7 月新题里有一道对文字处理要求极高的题,Pro preview 和多数国模得分极低,Flash 则跃升到国模第一,和 GPT-5.6 Luna 相当。约束求解类,Flash 和 Pro preview 互有胜负,极限相当。
幻觉控制上,上下文幻觉被有效压住。Flash 处理超长文本时,细节注意力强过 Pro preview,处在第一梯队但不算顶尖。编程方面,注意到 Flash 上下文超过约 400K 才开始丢原始指令要求,比之前的 Pro/Flash preview 更高。
任务效率上,Flash 单轮平均 Token 比 Pro preview 高约 24%,但分布不均。指令遵循类 Flash 更省,Token 能低到 Pro 的 50%;部分简单编程任务 Flash 原始直觉也更好,用量略低。其余场景 Flash 都高于 Pro。而且 Flash 在复杂 Agentic 任务上迭代轮次更多,同样任务下 Cache Read 比 Pro 高出 2.7 到 5 倍。按 API 计价,这部分差异让 Flash 成本只比 Pro preview 低约 30%。如果第三方 API 做不到 DeepSeek 原厂的 Cache 效率和成本,Flash 就会丢掉成本优势。
逻辑成绩
表格排序按中位分数降序。

1 表格为突出对比关系,只展示部分可对照模型,不是完整排序。
2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜。
3 完整榜单持续更新发布。
4 红字模型代表工作在推理模式(慢思考),黑色模型为对应的非推理模式(快思考)。
关于 DeepSeek 的路线
对能自己掌控迭代节奏的团队来说,什么时候发布不是问题,有没有做到理想状态才是问题。DeepSeek 想做大模型公司里的执牛耳者,自然不愿跟在别人后面拾人牙慧、亦步亦趋。北美前沿实验室在无人区开拓了 3 年,没有老师,只能信自己。DeepSeek 也是这套理念的践行者,在它眼里没有对手,只有终末之地。
对打算把大模型接进业务系统的团队来说,选型只是第一步。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。


2026年9月22日由阿里云主办的2026云栖大会在杭州开幕,云巴巴作为阿里云MaaS生态伙伴受邀出席;9月23日云巴巴首席AI架构师倪江玮在【智启新程:AI驱动创新企业】分论坛发表《从账号到产能,千问办公落地真实场景的FDE实践》主题演讲,系统呈现云巴巴推动千问办公进入企业真实场景的FDE方法论与三阶段六模块交付体系。

报销解决员工垫付回款,结算解决合作方按成果取酬,两者解决的问题不同。本文对等说明两种路径的形态、报销路径适合的场景与范围、平台结算路径的适用条件、四处关键差异以及按条件做选择的判断方式。

责任划分的起点是关系性质。本文说明标准劳动关系、不完全劳动关系与民事合作关系的区分依据,用工责任与控制环节的对应关系,平台承担的审核与留存义务,人员自身应尽的信息真实性义务以及争议的处理路径。

对公划转、个人收款、托管账户与批量代付各有适用条件。本文对等说明四类通道的形态、对公收款的适用场景与前提、个人收款的限制与维护要点、通道选择要看的四类条件以及合规核对的三条线索。

批量发放出现退回是规模上去之后的常见情形。本文说明退回的三类直接原因、人员与账户的分层核对顺序、退回之后的处理顺序与时限安排、减少同类退回的四项前置动作以及台账应保留的字段。