
智谱GLM-5.2在支持1M上下文的同时,把per-token FLOPs降低了约2.9倍,换算下来单次推理成本降到原来的三分之一左右。这件事的反直觉之处在于,上下文越长通常越贵,它却反向把成本压了下来,核心功臣是IndexShare架构,它动了稀疏注意力里容易被忽视的索引开销。
要理解IndexShare为什么有效,得先看清稀疏注意力里那个被忽视的隐性开销,正是它拖累了此前的长上下文方案,也让很多厂商的长上下文只能停留在演示阶段。
稀疏注意力的隐性开销:indexer
稀疏注意力的基本思路是,不让每个token都和全部历史token算注意力,只跟应当关注的top-k个历史token计算,从而把平方级复杂度拉回到接近线性。这看起来省了大头,但还藏着一个成本项没有算清,那就是索引器本身。
判断哪些token相关,需要一个indexer(索引器)为每个token挑出top-k位置。这个indexer本身要跑一遍计算,而且此前的方案是每层各自算一个,层数越深,indexer的累计开销越大,省下的注意力算力被索引器悄悄吃回一部分,整体收益被稀释。

GLM-5.1及更早的稀疏方案就卡在这里。注意力成本降了,索引成本升了,两项相抵后整体收益有限,长上下文依旧贵得用不起。IndexShare针对的正是这个被忽略的环节,它的切入点非常朴素:相邻层的注意力模式其实高度相似,没必要每层重算。
IndexShare 的共享机制:每 4 层一个 indexer
IndexShare的做法是,把Transformer的层按每4层分成一组,indexer只放在每组的第一层。第一层算出top-k索引后,后面3层直接复用同一份索引,不再重复计算indexer,等于把indexer的计算量砍掉了四分之三,这是成本下降的直接来源。
共享的是关注谁的判断,不是关注多少的计算。后面3层仍然用各自独立的注意力权重去读取被索引到的token,所以每层的表征能力没有因为共享而稀释,只是省掉了重复的索引决策,质量和效率得以同时保住,没有用效果换速度。

这个设计基于一个在训练中验证过的观察:相邻层的注意力模式相似,第1层认为该关注的token,第2到第4层也大致认同。既然判断趋同,就没必要每层重算,复用第一层的结果既保质量又省算力,这个朴素直觉在大规模训练中被证实成立。
训练阶段就嵌入,而非推理时硬加
IndexShare不是推理时才套上的优化壳,它从中期训练阶段就以128K序列长度参与训练。模型在学时就已经适应了4层共享一个索引的注意力结构,权重里固化的是共享后的模式,而不是训练完成后硬塞进去的补丁。
这一点很关键。很多长上下文优化是训练完成后才加的,模型没见过这种结构,效果难免回退。GLM-5.2因为训练期就嵌入IndexShare,在长上下文基准上的表现反而超过了不用IndexShare的GLM-5.1,同时计算量更少,质量与成本同向改善,这在优化里并不常见。

训练适配还带来一个好处:共享粒度可以跟着模型一起调。k值、分组层数、索引范围这些超参在训练过程中被共同优化,而不是靠后期手工拍脑袋定,这让IndexShare在不同任务上的泛化更稳,也不会因为换数据集就突然失效。
成本下降到三分之一意味着什么
把FLOPs的2.9倍下降换算成账单,假设不用IndexShare时1M上下文单次推理成本是X,用了之后约降到X除以2.9,也就是原来的约34%。这是per-token层面的优化,调用量越大,累计省下的钱越多,规模效应明显。
对用户来说,这意味着跑1M上下文的API成本远低于理论上的百万上下文价格,这也是智谱能以相对低价提供长上下文服务的技术基础。再叠加国产算力适配,算力硬件本身的成本也低于进口GPU,架构优化和硬件成本双重叠加,价格竞争力来自两层减法。
对于企业级场景,这个降幅直接改变了可行性边界。过去因长上下文账单过高而搁置的代码库问答、长篇合同审查、跨文档分析,现在可以纳入常规工作流,不必每次都为token数精打细算,长文本从奢侈品变成水电煤一样的日常消耗。
与其他长上下文方案的成本对照
业界主流长上下文方案各有取舍。直接扩展原生注意力实现门槛低,但计算开销偏高,且有效长度往往缩水。滑动窗口只盯邻近若干token加少量全局token,成本低却丢远距离信息。稀疏加独立indexer比直接扩展好,但索引开销大,正是GLM-5.1的处境,收益被自己吃掉。
稀疏加IndexShare是GLM-5.2的方案,共享索引砍掉四分之三索引计算,且训练期就适配,效果不打折。从成本效率看,它在当前1M上下文方案里处于前列,是少数把长和省同时做成卖点的设计,选型时值得把它和闭源方案放在一起算总账。
需要提醒的是,IndexShare的收益在长上下文下才充分显现。短上下文场景里索引开销占比小,共享带来的边际改善有限,这时更应该看模型本身的指令跟随和推理质量。换句话说,IndexShare是长文本场景的放大器,不是所有任务的胜负手,选型仍要按真实负载对号入座。
站在企业视角,IndexShare的价值要换算成年度账单才有意义。建议拿你典型的长上下文调用量,乘以单位token成本的变化,估出一年能省下的绝对数额,再和迁移与适配的投入比较。很多团队只盯相对降幅,忘了绝对体量,结果长上下文用得少,省下的钱覆盖不了改造费。先把自身调用结构摸清,再判断这项架构优化对你到底值不值。
行动建议
目前,智谱GLM-5.2已经在云巴巴平台上线。在云巴巴,你可以横向对比智谱GLM-5.2与同类产品的能力与价格,找到最适合你业务场景的AI解决方案。如果你正在评估大模型选型,或者想了解这款产品能为你省多少成本,云巴巴提供免费的产品咨询和方案对比服务。访问云巴巴,让专业顾问帮你做决策。


Qoder 知识引擎把一次性的项目搜索转成可复用、会进化的工程能力。本文拆解知识卡如何把工程语义变成 Agent 可消费的结构化上下文,并结合 SWE-bench Pro 实测,讲清它为何能提升任务得分、压低成本波动。

Qoder 用 ComputerUse 跑通自主迭代 Agent,靠 Goal 模式、自验证、回归守卫与项目记忆搭成自进化闭环,让不熟技术栈的人也能交付生产级软件,评测优于 Codex。

QoderWork 上线意识功能,由记忆、反思、技能进化组成闭环,让 AI 助手跨会话记住偏好、主动忘记过时内容、把高频流程固化为本领,额外成本仅主对话百分之五。

Qoder 的工程实践显示,当 AI 产出超过 Token 成本,瓶颈从模型转到人的精力。本文讲清三层委派、睡后 Token 与 Harness 平台,帮研发团队把人前移到决策位。

Qoder 全系夜间折扣上线,每晚十点到早八点切 Qwen3.7 低至两折,模型能力不变。Desktop、CLI、QoderWork、QoderWake、Cloud Agents 各自适合夜间无人值守场景,把大任务放心交给夜里。