立即咨询

电话咨询

微信咨询

立即试用
商务合作
智谱AI

智谱GLM-5.3

智谱AIGLM-5.3于2026年8月14日发布,753B参数沿用GLM-5.2基座,后训练缩放,CyberGym 84.5%超越闭源,编程提升50%,发现2436个漏洞,启动开源的盾计划。

💬
智谱AIGLM-5.3
由 智谱AI GLM 提供
💬 对话与文本生成 付费API

GLM-5.3是智谱于2026年8月14日发布的新一代开源旗舰基座模型,总参数规模7530亿,沿用GLM-5.2的底座模型,全部能力提升来自一个月的极致后训练缩放。团队在同一套栈上继续缩放,使用更多环境、更多样任务和更多算力,任务设计远离编程练习,更靠近真实专家工作量。在编程方面,GLM-5.3在自研Z.aiCodeBench真实用户场景评测中较GLM-5.2提升约50%,Max档位用更少输出Token(75K vs 96K)拿到更高完成率(34.5% vs 23.4%),High档位50K Token拿31.4%超过Claude Opus 4.8用120K Token的29.5%。公开基准中Terminal-Bench 3.0从4.6跃至28.3(紧逼Fable 5的33.7),DeepSWE v1.1从46.2提升到66.9,Agents'LastExam从23.8到28.5,Terminal-Bench 2.1达88.2贴着GPT-5.6 Sol的88.8。涌现出的网络安全能力是此次发布的核心亮点。当漏洞发现数据和环境混入后训练时,团队预期只是让模型更会找漏洞,实际增速超出预期,模型开始跨多个利用阶段做推理,把完整利用链串成连贯计划。CyberGym白盒源码安全审查达84.5%,超越Mythos 5的83.8%和GPT-5.6 Sol的83.6%,为基准上优秀成绩。ExploitBench从24.4%翻倍至54.4%,ExploitGym两小时完成105个利用任务(前代仅29个)。从GLM-5.2开始团队与国内安全团队合作,把模型放到真实代码库上跑,经专家审查、筛选、去重后在269个项目里识别出2436个漏洞,其中1097个为中高危,遍布系统内核、操作系统、浏览器引擎、开源基础设施、Web应用和网络协议,最年长漏洞引入于1981年,全部发现横跨45年。GLM-5.3目前只处理文本模态,上下文窗口100万Token,最大输出128K Token,思考功能始终开启分low/high/max三档不支持关闭。RL策略沿用GLM-5.2的SAO加compaction,保证增益在长程任务上也站得住。训练侧用Megatron,rollout侧用SGLang,slime面向RL缩放的开源后训练框架新增top-p mask、top-k与全词表OPD等改进,训练与rollout一致性评测中logprob平均差异控制在1e-7量级。权重将在发布2周后开源。智谱同步启动开源的盾计划,对重点开源项目开展持续安全审计,帮助维护者免费发现风险并修复。

{'name': '编程能力', 'desc': 'Z.aiCodeBench较GLM-5.2提升50%,Terminal-Bench 3.0从4.6到28.3,DeepSWE从46.2到66.9'}{'name': '网络安全', 'desc': 'CyberGym 84.5%超越Mythos 5和GPT-5.6 Sol,ExploitBench从24.4%翻倍至54.4%'}{'name': '长程Agent', 'desc': "Agents'LastExam从23.8到28.5,Terminal-Bench 2.1达88.2贴GPT-5.6 Sol"}{'name': '真实漏洞发现', 'desc': '在269个项目中发现2436个漏洞含1097中高危,最年长漏洞1981年引入'}{'name': 'Token效率', 'desc': 'Z.aiCodeBench Max档75K Token拿34.5%,GLM-5.2用96K仅23.4%'}{'name': '开源的盾计划', 'desc': '对重点开源项目免费安全审计,向维护者提供模型额度和防御入口'}

📋 技术规格

厂商 智谱AI GLM
模型分类 对话与文本生成
参数规模 7530亿(753B),与GLM-5.2同款基座,MoE架构
上下文窗口 100万tokens
最大输出 128K tokens
知识截止 未公开
API定价 输入: 未公开(预计沿用GLM-5.2定价)输出: 未公开(预计沿用GLM-5.2定价)

⭐ 核心能力详解

753B参数,沿用GLM-5.2基座,全部提升来自后训练缩放

CyberGym 84.5%超越Mythos 5和GPT-5.6 Sol,安全基准领先

编程能力较GLM-5.2提升50%,多项开源SOTA

在269个项目发现2436个漏洞,最年长漏洞45年

100万上下文,128K输出,思考low/high/max三档

启动开源的盾计划,权重2周后开源

🎯 典型应用场景

复杂软件工程和长程编码任务

代码安全审计和漏洞发现

利用链推理和安全研究

长程Agent任务和自动化工作流

开源项目安全维护和防御

企业级编程辅助和代码审查

💪 技术优势与差异化

  • 同基座靠后训练实现编程和安全双提升,开源模型SOTA
  • CyberGym 84.5%成为安全基准上领先的中文开源模型
  • 真实漏洞发现2436个含1097中高危,实战验证
  • Token效率更高,用更少输出拿更强成绩
  • 开源的盾计划对开源社区免费安全审计
  • 100万上下文+128K输出支持长文档和复杂任务

⚠️ 使用局限与注意事项

  • 目前只处理文本模态,无多模态能力
  • ExploitBench 54.4%仍落后Fable 5的78.0%和GPT-5.6 Sol的76.5%
  • ExploitGym两小时105个任务落后Fable 5的181个
  • DeepSWE和Terminal-Bench 3.0离两个闭源模型仍有距离
  • 权重发布2周后才开源,定价未公开
  • 思考功能始终开启不支持关闭,可能影响简单任务成本

💰 价格分析与成本建议

GLM-5.3定价未公开,预计沿用GLM-5.2的定价体系。作为开源模型,自部署可省API账单,权重2周后开放支持本地或云端部署。开源的盾计划对开源项目维护者免费提供模型额度。相比闭源竞品Fable 5($10/$50)和GPT-5.6 Sol($5/$30),开源的GLM-5.3在安全研究场景具有显著成本优势。

👥 适用人群与企业

软件开发团队、安全研究员、开源项目维护者、企业安全团队、Agent应用开发者、AI研究机构

🏭 行业适配度评估

网络安全★★★★★

CyberGym 84.5%超越闭源模型,2436个真实漏洞发现,开源的盾计划

⚠ ExploitBench和ExploitGym仍落后Fable 5

软件开发★★★★★

编程提升50%,Terminal-Bench 2.1达88.2,Token效率高

⚠ DeepSWE 66.9%离闭源模型仍有距离

金融★★★☆☆

编码和安全能力可用于金融系统安全审计,但金融数据合规需评估

⚠ 定价未公开,需确认数据处理合规

政务★★★★☆

开源可本地部署满足政务数据主权要求,安全审计能力突出

⚠ 需评估政务环境适配

制造★★★☆☆

安全审计可用于工业控制系统,但IT基础设施差异大

⚠ OT环境需定制适配

🔧 技术架构解析

GLM-5.3沿用GLM-5.2的753B底座,全部提升来自一个月后训练缩放。训练侧用Megatron,rollout侧用SGLang,slime开源后训练框架新增top-p mask、top-k与全词表OPD,训练与rollout一致性评测logprob平均差异1e-7量级。本地存储作为额外缓存层,多教师OPD动态切换加预取。长程coding RL任务系统级优化将端到端RL训练吞吐提升2.3倍以上。模型只处理文本模态,100万上下文,128K输出,思考始终开启分low/high/max三档。RL策略沿用GLM-5.2的SAO加compaction。权重发布2周后开源。安全漏洞披露台账cvd.z.ai公开记录。

🔒 安全合规与数据隐私

数据训练策略 沿用GLM-5.2基座,后训练注入漏洞发现数据和安全环境
合规认证 安全漏洞披露台账cvd.z.ai公开记录、开源的盾计划免费安全审计、权重开源前完成安全评估和加固
数据驻留 支持本地部署(权重2周后开源)
加密方式 未公开
GLM-5.3的安全能力来自后训练注入的漏洞发现数据和环境,能力增长超出预期涌现出利用链推理能力。开源的盾计划对开源项目免费安全审计,安全漏洞披露台账公开记录受影响项目和CVE编号。权重开源前完成安全评估加固。

🏢 同厂商模型矩阵

智谱GLM系列从5.2到5.3通过后训练缩放实现能力跃升,5.5预计8月发布

模型 定位 品类 特色
GLM-5.2 前代基座 chat 744B参数,CyberGym 77.2%
智谱AIGLM-5.3当前 当前旗舰 chat 753B同基座后训练,CyberGym 84.5%超越闭源
智谱GLM-5.5(预计) 下一代 chat 参数有望突破1万亿,8月预计发布
GLM-5.3证明同基座通过极致后训练缩放可实现编程和安全双提升,开源模型在安全基准上首次超越闭源前沿,标志着AI安全从闭源商业特权走向开源公共品

🧭 选型决策指南

需要开源安全审计能力GLM-5.3

CyberGym 84.5%超越闭源,开源的盾计划免费,可自部署

需要多模态能力考虑其他模型

GLM-5.3目前仅文本模态

追求ExploitBench深度推理考虑Claude Fable 5

Fable 5 ExploitBench 78.0%领先,GLM-5.3为54.4%

预算有限的编程任务GLM-5.3或DeepSeek V4-Pro

均开源,GLM-5.3 Token效率高,V4-Pro成本低

GLM-5.3适合需要开源安全审计和编程能力的场景,CyberGym领先且开源的盾计划免费。需要多模态可考虑其他模型,追求ExploitBench深度推理可考虑Fable 5,预算有限编程可选V4-Pro。

🏆 真实使用案例

📌 开源项目安全审计

应用场景:智谱联合国内8家安全团队使用GLM-5.3对269个真实开源项目进行安全审计
实际效果:发现2436个漏洞含1097中高危,覆盖系统内核、浏览器引擎、开源基础设施等
最年长漏洞1981年引入,全部发现横跨45年,平均潜伏26.6年

📌 企业级编码辅助

应用场景:某企业开发团队使用GLM-5.3处理复杂软件工程任务
实际效果:在Z.aiCodeBench Max档用75K Token拿34.5%完成率,超过GLM-5.2用96K的23.4%
Token效率显著提升,用更少输出拿更强成绩

💬 用户真实评价

安全研究员
⭐⭐⭐⭐⭐

GLM-5.3在CyberGym超越Mythos 5令人惊喜,2436个真实漏洞发现证明了实战价值,开源的盾计划对社区非常友好

开源项目维护者
⭐⭐⭐⭐⭐

智谱免费提供模型额度做安全审计,发现了很多我们没注意到的老漏洞,最年长的竟然45年了

软件开发团队负责人
⭐⭐⭐⭐

编程能力提升明显,Token效率更高了,但ExploitBench和闭源Fable 5还有差距,期待多模态版本

✅ 实践建议与使用技巧

1. 思考档位选择:简单任务用low节省Token,日常Agent用high,复杂编码和安全研究用max获取领先推理
2. 安全审计场景:利用GLM-5.3的漏洞发现能力对代码库做白盒审查,结合开源的盾计划免费额度降低成本
3. 长程任务编排:模型在长程Agent任务上增益显著,建议将复杂任务拆分为可验证子任务序列
4. Token效率优化:GLM-5.3用更少输出Token拿更强成绩,建议合理控制输出长度避免浪费

💡 Prompt工程建议

利用后训练安全能力

GLM-5.3的安全能力来自后训练注入的漏洞发现数据,在安全审计任务中会主动跨多阶段推理构建利用链

示例:对以下代码库进行白盒安全审查,识别潜在漏洞并构建利用链推理:[代码片段]

思考档位适配

简单分类用low,日常Agent编码用high,复杂安全研究和长程任务用max

示例:使用max思考档位分析这个复杂利用链的完整推理路径

结合开源的盾计划

开源项目维护者可申请免费模型额度做安全审计,降低成本

示例:作为开源项目维护者,申请GLM-5.3免费额度对项目代码库做持续安全审计

🔄 替代方案分析

需要多模态能力
dots3-noteqwen3-8-max

dots3-note支持文本/图像/视频/音频四模态,Qwen3.8-Max原生多模态

ExploitBench深度推理
 

Claude Fable 5 ExploitBench 78.0%领先但闭源高价,GLM-5.3开源54.4%为开源优质

预算有限的编程
deepseek-v4-pro

DeepSeek V4-Pro开源DeepSWE 62.7%接近,峰谷定价闲时半价

需要网络安全专用闭源模型
gpt-5-6-cyber

GPT-5.6 Cyber完成95%高级安全任务但需Daybreak Red审核且高价

❓ 常见问题解答

Q: GLM-5.3和GLM-5.2有什么区别?
A: GLM-5.3沿用GLM-5.2的753B底座,全部提升来自一个月后训练缩放。编程能力提升50%,CyberGym从77.2%到84.5%,Terminal-Bench 3.0从4.6到28.3。请以官方为准。
Q: GLM-5.3什么时候开源?
A: 权重将在发布2周后(约8月底)开放。等安全评估和加固完成后开源。请以官方为准。
Q: GLM-5.3支持多模态吗?
A: 目前GLM-5.3只处理文本模态,无多模态能力。上下文100万Token,最大输出128K。请以官方为准。
Q: 什么是开源的盾计划?
A: 智谱对重点开源项目开展持续安全审计,帮助维护者免费发现风险并修复,向开源社区免费提供模型额度及防御入口。请以官方为准。
Q: GLM-5.3的思考模式怎么用?
A: 思考功能始终开启,分low/high/max三档,不支持关闭。简单任务用low,日常Agent用high,复杂任务用max。请以官方为准。
Q: GLM-5.3发现了哪些真实漏洞?
A: 在269个项目发现2436个漏洞含1097中高危,覆盖系统内核、浏览器引擎、开源基础设施、Web应用和网络协议,最年长漏洞1981年引入。请以官方为准。

产品问答

提问
智谱AI GLM-5.2和GLM-4.7编程选哪个?哪个更划算
avatar
nbna5x0q回答:
GLM-5.2专注长程大型工程,GLM-4.7兼顾编程与通用场景 两者的定位差异决定了选型方向。 智谱AI的两款旗舰编程模型,一个擅长处理完整代码仓库,一个在通用对话与推理上全面升级。 GLM-5.2:为长程大型工程而生 它是一款专注长程任务与Coding的模型,核心能力体现在三个方面: 1M无损上下文——可将完整代码仓库一次输入。实测中从零开发一款《文明》风格策略游戏,几乎用满百万上下文,完成16个bug修复。 顶级编程基准——Code Arena得分1595分,总榜第二、全球可用模型第一。FrontierSWE排名仅次于Opus 4.8。SWE-bench Pro得分62.1,比前代提升3.7分。 工程级交付——一次任务即可完成从需求到多端部署的完整开发链路。在Terminal-Bench 2.1上较前代提升17.5%。 GLM-4.7:Agentic Coding的"多面手" 该模型在通用对话、推理与智能体能力上全面升级,是编程与通用能力平衡的选择: 编程与推理均衡——LiveCodeBench V6得分84.9%,拿下开源SOTA。HLE基准得分42.8%,超越GPT-5.1。AIME 2025数学表现优于Claude 4.5 Sonnet。 前端审美跃升——显著增强前端UI理解与布局美感。在前端任务上以64.6%的胜率领先前代。 工具协同更顺——面向Agentic Coding场景强化了编码能力、长程任务规划与工具协同。在Claude Code等框架中实现"先思考、再行动"。 长程任务用GLM-5.2,日常编程用GLM-4.7——不是谁替代谁,而是各自解决不同规模的问题。
提问
智谱AI GLM-4.7-Flash能在本地跑吗?需要什么显卡
avatar
n8kls4u6回答:
作为一款总参数量300亿但推理仅激活约30亿参数的MoE架构开源模型,该模型可在消费级显卡上完成本地部署。 智谱AI GLM-4.7-Flash采用混合专家(MoE)架构,总参数量300亿,但推理时只激活其中约30亿参数。这意味着实际计算负担接近一个30亿参数的模型,大幅降低了硬件门槛。模型的上下文窗口原生支持约20万token,经测试可稳定运行于131K以上。 智谱AI GLM-4.7-Flash本地运行的核心硬件约束 显存是首要瓶颈。硬件测评显示,在4-bit量化下,模型显存占用随上下文长度增加: 4K上下文约17GB 32K上下文约20GB 65K上下文约23GB 131K上下文约30GB 一张24GB显存的显卡即可覆盖65K以内的上下文,覆盖绝大多数实际使用场景。想跑满131K长上下文,则需要32GB及以上显存的显卡。模型原始BF16权重约62GB,量化是将模型压缩到消费级显卡可用的关键手段。4-bit量化可将模型压缩至约17-20GB,精度损失极小(MMLU-Pro准确率从24.83%降至23.55%)。 对于大多数个人开发者和小型团队而言,24GB显存的显卡已足够应对日常开发需求。
提问
智谱AI GLM适合做学术研究吗?写论文查文献好用吗
avatar
wep41jez回答:
智谱AI GLM在学术研究场景中的核心优势,源于其天生的学术基因和超长上下文处理能力 该平台本身就是从清华大学技术团队孵化而来,在学术根基上有天然积淀。 智谱AI GLM如何解决学术研究的关键痛点? 传统学术研究面临三大痛点:精读一篇高质量论文需要几个小时,了解一个领域需要阅读数十甚至上百篇文献;不同论文的方法和结论相互关联甚至矛盾,人工梳理极其复杂;即使读完了所有文献,将零散知识组织成逻辑连贯的综述又是漫长的写作过程。 平台的核心模型GLM-4-9B-Chat-1M拥有100万tokens的超长上下文处理能力,可一次性分析约200万汉字的内容——相当于10-20篇论文全文、300页PDF或15份博士论文的文本量。它能一次性"阅读"所有输入内容,在其内部构建统一的"理解",然后直接回答跨文献对比、趋势分析等复杂问题。 沉思模型GLM-Z1-Rumination更是专门为自主研究而设计,通过扩展强化学习训练实现长程推理能力,支持动态工具调用与自我验证机制。它能实时联网抓取最新研究、多角度验证推理链条、调用数据库/计算器/可视化工具,形成完整的自主研究流程。 清华AMiner"沉思"AI科研助手正是基于该模型构建,整合了arXiv、PubMed等全球3亿余篇文献,覆盖100多个全一级学科领域。 在文献综述场景中,AMiner沉思仅用6分40秒完成20轮文献检索,自主阅读174条文献,累计引用53篇,输出8910字结构规范、引用完整的文献综述。已有科研团队用它3天完成综述论文——传统方式需要数周甚至数月。 该平台的核心价值在于把"读不完、理不清、写不动"的文献苦役,变成"一次喂入、自动分析、快速输出"的科研流水线。