立即咨询

电话咨询

微信咨询

立即试用
商务合作

DeepSeek V4 Flash 测评:企业落地要看这几点

2026-08-03

 

 

DeepSeek V4 Flash 测评:企业落地要看这几点

基本情况

 

300b 这个尺寸,各家团队给出的上限判断并不一样。MiniMax 率先交卷,认为 300b 只能满足日常轻度需求;混元则认为它足以承担大部分不算复杂的工程任务;OpenAI 把小尺寸 Luna 交给 AI 自迭代训练当试验田,结果还不尽如人意。DeepSeek 的态度更激进,认为 300b 远没到极限,既能做高智力推理,也能撑起复杂开发。

从推理看,新 Flash 的极限打平自家的 1.6T Pro preview,稳定性还反超了。代价是 Token 消耗涨了 50%,这是后训练要付的账。Agentic 编程能力则完全超过 Pro preview,基本摸到了高可用区间的下限。

编程 Agent

 

 

测试方式参见:大模型编程应用测试-V3榜单。

Flash 的编程表现差异很大,差异同时来自语言方向和 Harness 两类。前端这类训练语料和方法更成熟的领域,效果明显更好,成品可以跟参数大近 3 倍的 GLM-5.2 打平。但到了 Rust、Swift 这些非热门领域,效果断崖式下跌,Flash 大体知道要做什么,细节掌握度还是不如前端。对比之下,Pro/Flash preview 版本连该做什么、怎么推进都不太清楚。

Harness 差异主要在 Claude Code 和 Codex 的默认设置与工具链不同。Claude Code 默认的单次输出长度限制了 Flash 的发挥。Flash 和之前的 preview 一样,喜欢动手前先想清楚,复杂项目规划阶段一次思考可能到 50K Token。Codex 因为自身迭代频繁,Flash 对其中工具的使用效率偏低,同样任务可能多花 30% 到 40% 的步数。不过最终效果看,两种 Harness 差别不大。即将发布的自家 Harness 能同时解决默认配置和工具熟悉两个问题,至少不在这方面拖后腿。

视觉方面,Flash 依然没有视觉能力,但前端审美比前代 preview 高了不少。之前 preview 直出 UI 是 Demo 级,进不了生产环境;正式版的 UI 精度、配色、尺寸、交互细节基本到了准生产级,甚至会主动加转场、icon 动效这类小设计,这在部分更高阶模型里也不多见。需要说明的是,Flash 的 UI 能力仍弱于第一梯队头部模型,尤其 web 端以外的 UI 构建。涉及建模、动画场景,Flash 劣势明显,露出训练不充分的状态,而这恰恰是大尺寸前沿模型的强项。

Flash 的自测和验证手段很丰富。除了传统测试用例,它还会把截图转成 ASCII 字符图来间接理解画面状态,也会写自动化序列操作去复现复杂动画场景,再读逐帧状态数值判断动画有没有问题。这些手段大多有效,比如 F 项目 Godot 场景里,Flash 靠自测发现并修掉了几乎所有功能 Bug,剩下主要是交互和性能问题。

推理能力上,和 Pro preview 比,Flash 做不到完胜。它的优势主要来自编程和写作训练泛化出的元能力,比如指令遵循和文字处理。7 月新题里有一道对文字处理要求极高的题,Pro preview 和多数国模得分极低,Flash 则跃升到国模第一,和 GPT-5.6 Luna 相当。约束求解类,Flash 和 Pro preview 互有胜负,极限相当。

幻觉控制上,上下文幻觉被有效压住。Flash 处理超长文本时,细节注意力强过 Pro preview,处在第一梯队但不算顶尖。编程方面,注意到 Flash 上下文超过约 400K 才开始丢原始指令要求,比之前的 Pro/Flash preview 更高。

任务效率上,Flash 单轮平均 Token 比 Pro preview 高约 24%,但分布不均。指令遵循类 Flash 更省,Token 能低到 Pro 的 50%;部分简单编程任务 Flash 原始直觉也更好,用量略低。其余场景 Flash 都高于 Pro。而且 Flash 在复杂 Agentic 任务上迭代轮次更多,同样任务下 Cache Read 比 Pro 高出 2.7 到 5 倍。按 API 计价,这部分差异让 Flash 成本只比 Pro preview 低约 30%。如果第三方 API 做不到 DeepSeek 原厂的 Cache 效率和成本,Flash 就会丢掉成本优势。

逻辑成绩

 

表格排序按中位分数降序。

 

1 表格为突出对比关系,只展示部分可对照模型,不是完整排序。

2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜。

3 完整榜单持续更新发布。

4 红字模型代表工作在推理模式(慢思考),黑色模型为对应的非推理模式(快思考)。

关于 DeepSeek 的路线

 

对能自己掌控迭代节奏的团队来说,什么时候发布不是问题,有没有做到理想状态才是问题。DeepSeek 想做大模型公司里的执牛耳者,自然不愿跟在别人后面拾人牙慧、亦步亦趋。北美前沿实验室在无人区开拓了 3 年,没有老师,只能信自己。DeepSeek 也是这套理念的践行者,在它眼里没有对手,只有终末之地。

对打算把大模型接进业务系统的团队来说,选型只是第一步。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。

热门数字化产品

腾讯云智能内容生成平台腾讯云智能内容生成平台可以提供辅助内容创作、创新的AI服务, 主要包括内容理解、内容处理、内容生成。从而降低内容创作者的创作、创新门槛, 提升创作、创新效率。
精臣云资产固定资产管理系统精臣云资产固定资产管理系统提供全生命周期的资产管理解决方案。它通过云计算和物联网技术,实现资产的实时追踪与管理,支持资产盘点、折旧计算、维修记录等功能。系统特点包括采购管理、资产入库、日常管理、标签打印、资产盘点、耗材管理、单据审批和资产报表等。精臣云资产旨在提升资产管理的透明度和效率,降低管理成本,适用于多种企业场景。
携客云采购管理系统SRM携客云的每个应用功能都经过用户的千锤百炼,无论是大型的集团,或是快速成长的企业,都能够为您企业供应链每个管理环节,找到最佳的业务管理方案,并配置您所需要的管理流程和业务细节。
炎黄盈动AWS PaaS低代码平台炎黄盈动AWS PaaS低代码平台,PaaS是数字化转型的基石,支撑/探索不同发展级别的能力要求,以强大低代码能力 + 全场景BPM优势,引领国内PaaS市场发展。平台总体架构,成熟稳定、简单强大,轻,微应用,满足持续、大规模构建核心业务的苛刻要求。
Qoder CN 智能体编程平台Qoder 是阿里巴巴推出的面向真实软件开发的 Agentic 编码平台,基于增强上下文工程与智能体无缝结合。产品提供 Editor 与 Quest 两种工作视图,Editor 适合就地协作与快速迭代,Quest 面向自主委派的长程多步任务,支持 Spec 驱动开发与 Repo Wiki 知识可视化。
为你推荐
三个店铺三套报表怎么办?家居卖家的生意地图整合记

以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

2026-08-13
报价整理太慢怎么办?机械外贸用Accio Work备好询盘弹药

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

2026-08-13
客服离职交接乱怎么办?知识库沉淀让Accio Work无缝顶岗

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

2026-08-13
上新总拖一周怎么办?服装卖家用Accio Work当天铺完三平台

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

2026-08-13
询盘半夜来怎么办?一家五金厂用Accio Work接住时差商机

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。

2026-08-13
查看更多