GLM-5.3是智谱于2026年8月14日发布的新一代开源旗舰基座模型,总参数规模7530亿,沿用GLM-5.2的底座模型,全部能力提升来自一个月的极致后训练缩放。团队在同一套栈上继续缩放,使用更多环境、更多样任务和更多算力,任务设计远离编程练习,更靠近真实专家工作量。在编程方面,GLM-5.3在自研Z.aiCodeBench真实用户场景评测中较GLM-5.2提升约50%,Max档位用更少输出Token(75K vs 96K)拿到更高完成率(34.5% vs 23.4%),High档位50K Token拿31.4%超过Claude Opus 4.8用120K Token的29.5%。公开基准中Terminal-Bench 3.0从4.6跃至28.3(紧逼Fable 5的33.7),DeepSWE v1.1从46.2提升到66.9,Agents'LastExam从23.8到28.5,Terminal-Bench 2.1达88.2贴着GPT-5.6 Sol的88.8。涌现出的网络安全能力是此次发布的核心亮点。当漏洞发现数据和环境混入后训练时,团队预期只是让模型更会找漏洞,实际增速超出预期,模型开始跨多个利用阶段做推理,把完整利用链串成连贯计划。CyberGym白盒源码安全审查达84.5%,超越Mythos 5的83.8%和GPT-5.6 Sol的83.6%,为基准上优秀成绩。ExploitBench从24.4%翻倍至54.4%,ExploitGym两小时完成105个利用任务(前代仅29个)。从GLM-5.2开始团队与国内安全团队合作,把模型放到真实代码库上跑,经专家审查、筛选、去重后在269个项目里识别出2436个漏洞,其中1097个为中高危,遍布系统内核、操作系统、浏览器引擎、开源基础设施、Web应用和网络协议,最年长漏洞引入于1981年,全部发现横跨45年。GLM-5.3目前只处理文本模态,上下文窗口100万Token,最大输出128K Token,思考功能始终开启分low/high/max三档不支持关闭。RL策略沿用GLM-5.2的SAO加compaction,保证增益在长程任务上也站得住。训练侧用Megatron,rollout侧用SGLang,slime面向RL缩放的开源后训练框架新增top-p mask、top-k与全词表OPD等改进,训练与rollout一致性评测中logprob平均差异控制在1e-7量级。权重将在发布2周后开源。智谱同步启动开源的盾计划,对重点开源项目开展持续安全审计,帮助维护者免费发现风险并修复。
📋 技术规格
| 厂商 | 智谱AI GLM |
|---|---|
| 模型分类 | 对话与文本生成 |
| 参数规模 | 7530亿(753B),与GLM-5.2同款基座,MoE架构 |
| 上下文窗口 | 100万tokens |
| 最大输出 | 128K tokens |
| 知识截止 | 未公开 |
| API定价 | 输入: 未公开(预计沿用GLM-5.2定价)输出: 未公开(预计沿用GLM-5.2定价) |
⭐ 核心能力详解
753B参数,沿用GLM-5.2基座,全部提升来自后训练缩放
CyberGym 84.5%超越Mythos 5和GPT-5.6 Sol,安全基准领先
编程能力较GLM-5.2提升50%,多项开源SOTA
在269个项目发现2436个漏洞,最年长漏洞45年
100万上下文,128K输出,思考low/high/max三档
启动开源的盾计划,权重2周后开源
🎯 典型应用场景
复杂软件工程和长程编码任务
代码安全审计和漏洞发现
利用链推理和安全研究
长程Agent任务和自动化工作流
开源项目安全维护和防御
企业级编程辅助和代码审查
💪 技术优势与差异化
- 同基座靠后训练实现编程和安全双提升,开源模型SOTA
- CyberGym 84.5%成为安全基准上领先的中文开源模型
- 真实漏洞发现2436个含1097中高危,实战验证
- Token效率更高,用更少输出拿更强成绩
- 开源的盾计划对开源社区免费安全审计
- 100万上下文+128K输出支持长文档和复杂任务
⚠️ 使用局限与注意事项
- 目前只处理文本模态,无多模态能力
- ExploitBench 54.4%仍落后Fable 5的78.0%和GPT-5.6 Sol的76.5%
- ExploitGym两小时105个任务落后Fable 5的181个
- DeepSWE和Terminal-Bench 3.0离两个闭源模型仍有距离
- 权重发布2周后才开源,定价未公开
- 思考功能始终开启不支持关闭,可能影响简单任务成本
💰 价格分析与成本建议
GLM-5.3定价未公开,预计沿用GLM-5.2的定价体系。作为开源模型,自部署可省API账单,权重2周后开放支持本地或云端部署。开源的盾计划对开源项目维护者免费提供模型额度。相比闭源竞品Fable 5($10/$50)和GPT-5.6 Sol($5/$30),开源的GLM-5.3在安全研究场景具有显著成本优势。
👥 适用人群与企业
软件开发团队、安全研究员、开源项目维护者、企业安全团队、Agent应用开发者、AI研究机构
🏭 行业适配度评估
CyberGym 84.5%超越闭源模型,2436个真实漏洞发现,开源的盾计划
⚠ ExploitBench和ExploitGym仍落后Fable 5
编程提升50%,Terminal-Bench 2.1达88.2,Token效率高
⚠ DeepSWE 66.9%离闭源模型仍有距离
编码和安全能力可用于金融系统安全审计,但金融数据合规需评估
⚠ 定价未公开,需确认数据处理合规
开源可本地部署满足政务数据主权要求,安全审计能力突出
⚠ 需评估政务环境适配
安全审计可用于工业控制系统,但IT基础设施差异大
⚠ OT环境需定制适配
🔧 技术架构解析
GLM-5.3沿用GLM-5.2的753B底座,全部提升来自一个月后训练缩放。训练侧用Megatron,rollout侧用SGLang,slime开源后训练框架新增top-p mask、top-k与全词表OPD,训练与rollout一致性评测logprob平均差异1e-7量级。本地存储作为额外缓存层,多教师OPD动态切换加预取。长程coding RL任务系统级优化将端到端RL训练吞吐提升2.3倍以上。模型只处理文本模态,100万上下文,128K输出,思考始终开启分low/high/max三档。RL策略沿用GLM-5.2的SAO加compaction。权重发布2周后开源。安全漏洞披露台账cvd.z.ai公开记录。
🔒 安全合规与数据隐私
| 数据训练策略 | 沿用GLM-5.2基座,后训练注入漏洞发现数据和安全环境 |
|---|---|
| 合规认证 | 安全漏洞披露台账cvd.z.ai公开记录、开源的盾计划免费安全审计、权重开源前完成安全评估和加固 |
| 数据驻留 | 支持本地部署(权重2周后开源) |
| 加密方式 | 未公开 |
🏢 同厂商模型矩阵
智谱GLM系列从5.2到5.3通过后训练缩放实现能力跃升,5.5预计8月发布
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| GLM-5.2 | 前代基座 | chat | 744B参数,CyberGym 77.2% |
| 智谱AIGLM-5.3当前 | 当前旗舰 | chat | 753B同基座后训练,CyberGym 84.5%超越闭源 |
| 智谱GLM-5.5(预计) | 下一代 | chat | 参数有望突破1万亿,8月预计发布 |
🧭 选型决策指南
CyberGym 84.5%超越闭源,开源的盾计划免费,可自部署
GLM-5.3目前仅文本模态
Fable 5 ExploitBench 78.0%领先,GLM-5.3为54.4%
均开源,GLM-5.3 Token效率高,V4-Pro成本低
🏆 真实使用案例
📌 开源项目安全审计
📌 企业级编码辅助
💬 用户真实评价
GLM-5.3在CyberGym超越Mythos 5令人惊喜,2436个真实漏洞发现证明了实战价值,开源的盾计划对社区非常友好
智谱免费提供模型额度做安全审计,发现了很多我们没注意到的老漏洞,最年长的竟然45年了
编程能力提升明显,Token效率更高了,但ExploitBench和闭源Fable 5还有差距,期待多模态版本
✅ 实践建议与使用技巧
💡 Prompt工程建议
利用后训练安全能力
GLM-5.3的安全能力来自后训练注入的漏洞发现数据,在安全审计任务中会主动跨多阶段推理构建利用链
思考档位适配
简单分类用low,日常Agent编码用high,复杂安全研究和长程任务用max
结合开源的盾计划
开源项目维护者可申请免费模型额度做安全审计,降低成本
🔄 替代方案分析
dots3-note支持文本/图像/视频/音频四模态,Qwen3.8-Max原生多模态
Claude Fable 5 ExploitBench 78.0%领先但闭源高价,GLM-5.3开源54.4%为开源优质
DeepSeek V4-Pro开源DeepSWE 62.7%接近,峰谷定价闲时半价
GPT-5.6 Cyber完成95%高级安全任务但需Daybreak Red审核且高价








首页 

2026-08-27


3个回答 


