
DeepSeek V4 Flash 测评:企业落地要看这几点
基本情况
300b 这个尺寸,各家团队给出的上限判断并不一样。MiniMax 率先交卷,认为 300b 只能满足日常轻度需求;混元则认为它足以承担大部分不算复杂的工程任务;OpenAI 把小尺寸 Luna 交给 AI 自迭代训练当试验田,结果还不尽如人意。DeepSeek 的态度更激进,认为 300b 远没到极限,既能做高智力推理,也能撑起复杂开发。
从推理看,新 Flash 的极限打平自家的 1.6T Pro preview,稳定性还反超了。代价是 Token 消耗涨了 50%,这是后训练要付的账。Agentic 编程能力则完全超过 Pro preview,基本摸到了高可用区间的下限。
编程 Agent

测试方式参见:大模型编程应用测试-V3榜单。
Flash 的编程表现差异很大,差异同时来自语言方向和 Harness 两类。前端这类训练语料和方法更成熟的领域,效果明显更好,成品可以跟参数大近 3 倍的 GLM-5.2 打平。但到了 Rust、Swift 这些非热门领域,效果断崖式下跌,Flash 大体知道要做什么,细节掌握度还是不如前端。对比之下,Pro/Flash preview 版本连该做什么、怎么推进都不太清楚。
Harness 差异主要在 Claude Code 和 Codex 的默认设置与工具链不同。Claude Code 默认的单次输出长度限制了 Flash 的发挥。Flash 和之前的 preview 一样,喜欢动手前先想清楚,复杂项目规划阶段一次思考可能到 50K Token。Codex 因为自身迭代频繁,Flash 对其中工具的使用效率偏低,同样任务可能多花 30% 到 40% 的步数。不过最终效果看,两种 Harness 差别不大。即将发布的自家 Harness 能同时解决默认配置和工具熟悉两个问题,至少不在这方面拖后腿。
视觉方面,Flash 依然没有视觉能力,但前端审美比前代 preview 高了不少。之前 preview 直出 UI 是 Demo 级,进不了生产环境;正式版的 UI 精度、配色、尺寸、交互细节基本到了准生产级,甚至会主动加转场、icon 动效这类小设计,这在部分更高阶模型里也不多见。需要说明的是,Flash 的 UI 能力仍弱于第一梯队头部模型,尤其 web 端以外的 UI 构建。涉及建模、动画场景,Flash 劣势明显,露出训练不充分的状态,而这恰恰是大尺寸前沿模型的强项。
Flash 的自测和验证手段很丰富。除了传统测试用例,它还会把截图转成 ASCII 字符图来间接理解画面状态,也会写自动化序列操作去复现复杂动画场景,再读逐帧状态数值判断动画有没有问题。这些手段大多有效,比如 F 项目 Godot 场景里,Flash 靠自测发现并修掉了几乎所有功能 Bug,剩下主要是交互和性能问题。
推理能力上,和 Pro preview 比,Flash 做不到完胜。它的优势主要来自编程和写作训练泛化出的元能力,比如指令遵循和文字处理。7 月新题里有一道对文字处理要求极高的题,Pro preview 和多数国模得分极低,Flash 则跃升到国模第一,和 GPT-5.6 Luna 相当。约束求解类,Flash 和 Pro preview 互有胜负,极限相当。
幻觉控制上,上下文幻觉被有效压住。Flash 处理超长文本时,细节注意力强过 Pro preview,处在第一梯队但不算顶尖。编程方面,注意到 Flash 上下文超过约 400K 才开始丢原始指令要求,比之前的 Pro/Flash preview 更高。
任务效率上,Flash 单轮平均 Token 比 Pro preview 高约 24%,但分布不均。指令遵循类 Flash 更省,Token 能低到 Pro 的 50%;部分简单编程任务 Flash 原始直觉也更好,用量略低。其余场景 Flash 都高于 Pro。而且 Flash 在复杂 Agentic 任务上迭代轮次更多,同样任务下 Cache Read 比 Pro 高出 2.7 到 5 倍。按 API 计价,这部分差异让 Flash 成本只比 Pro preview 低约 30%。如果第三方 API 做不到 DeepSeek 原厂的 Cache 效率和成本,Flash 就会丢掉成本优势。
逻辑成绩
表格排序按中位分数降序。

1 表格为突出对比关系,只展示部分可对照模型,不是完整排序。
2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜。
3 完整榜单持续更新发布。
4 红字模型代表工作在推理模式(慢思考),黑色模型为对应的非推理模式(快思考)。
关于 DeepSeek 的路线
对能自己掌控迭代节奏的团队来说,什么时候发布不是问题,有没有做到理想状态才是问题。DeepSeek 想做大模型公司里的执牛耳者,自然不愿跟在别人后面拾人牙慧、亦步亦趋。北美前沿实验室在无人区开拓了 3 年,没有老师,只能信自己。DeepSeek 也是这套理念的践行者,在它眼里没有对手,只有终末之地。
对打算把大模型接进业务系统的团队来说,选型只是第一步。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。


以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。