
智谱把 Autonomous Agent 的终极形态描述成 7×24 小时全自治运转:领一个目标,Agent 自己干一整天甚至更久,中间不用人盯,出错自己纠,干完自己汇报。这个画面很诱人,但今天的模型离它还有距离。智谱自己把差距归因到三块能力:记忆、持续学习和自我评判。这三块,正是全自治的三道坎,也是它下一步攻关的明确靶心。
全自治的智能体长什么样:7×24 的运转要求
7×24 不是字面上的不关机,而是能力上的不间断。它要求 Agent 在长时段里持续接收任务、调用工具、积累中间结果,并且保持目标不跑偏。人下班了它还在跑,人睡了它还在推进,第二天交出一串已完成的工作。这种运转对稳定性和自洽性的要求,远高于单次对话,容错率被压到极低。
对照今天的基准能看清差距。GLM-5.2 在数小时到数十小时的中程任务上已经追平闭源前沿,但在需要连续数十小时的超长程软件工程基准上仍落后约 13%。智谱官方也承认这一项"还有成长空间"。这 13% 的落差,恰恰指向长时段自治的短板,而不是单次能力的不足,问题出在长跑不在冲刺。

短板的根源不在模型不够聪明,而在它缺少"带着记忆长跑"的机制。短任务靠上下文窗口就能撑住,长任务需要跨步骤、跨会话地保留和调用经验。没有这套机制,任务越长,遗忘和漂移越严重,自治就崩在半路。所以智谱把记忆、学习、评判列为下一阶段,而不是继续堆参数,方向选得很准。
Memory 难题:让 Agent 记住跨会话的经验
记忆要解决的第一件事,是跨会话留存。今天的模型每次新对话基本从零开始,上一轮学到的用户偏好、项目约定、踩过的坑,下一轮大多归零。对人类来说这像得了顺行性遗忘,永远在重复踩同一个坑。Agent 要自治,必须先治好这个病,否则每次开工都像新人报到。
第二件事是结构化记忆。零散往上下文里塞历史记录会撑爆窗口且噪声大,理想的记忆应是分层的一层是长期偏好,一层是本次任务的进度,一层是随时可调取的细节。Agent 要会决定什么值得记、什么该忘、什么临时检索。这套取舍本身就需要模型有判断力,记忆不是越多越好,而是越准越好。

第三件事是记忆的可靠性。记错了比不记更糟,错误的记忆会在长程里反复放大。智谱在长上下文架构上的积累,比如 IndexShare 对超长序列的优化,为记忆的存储和检索提供了底层支撑,但"记什么、怎么用"仍是开放问题。记忆这道坎,难在不仅要存得下,还要用得对,存储是工程,调用是智能。
持续学习:从执行轨迹里长出本领
持续学习要解决的,是 Agent 越用越聪明。人类员工做十次同类任务,第十一次会明显更顺,因为人从反馈里提炼了经验。今天的模型每次执行都依赖同一份预训练权重,做完就忘,不会把这次的教训变成下次的能力。这种失忆让自治的天花板被锁死,模型永远停留在出厂水平。
实现路径有几条。其一是从执行轨迹里做自监督,把成功和失败的步骤标记出来,让模型学会哪种策略更稳。其二是让用户反馈闭环,人对 Agent 产出打分或修正,模型据此微调。其三是多 Agent 互相教,一个 Agent 的探索经验同步给同伴。无论哪条,核心都是让经验可累积,把一次性执行变成持续性成长。

持续学习也带来风险。学偏了、学坏了怎么办,模型在长程里固化了某个错误策略,会比随机犯错更难排查。智谱把这块列为攻关方向,说明它清楚学习的双刃剑。能学是自治的前提,学得可控才是自治能上生产的门槛。没有刹车的学习,比没有学习更危险,这是工程落地必须直面的辩证。
自我评判:没有监督时也能及时止损
自我评判要解决的是"没人盯也能刹车"。人类员工独立完成长任务时,靠的是随时自检:这步不对劲,先停,回头查。Agent 若没有这层能力,就会把错误一路执行到底,等到人发现,损失已经造成。对 7×24 自治来说,自我评判是安全气囊,没有它就不该放手让模型长跑。
评判的对象有两层。一层是过程,Agent 要判断当前步骤有没有偏离计划、工具返回是否异常。另一层是结果,Agent 要能验证自己的产出对不对,而不是生成完就交差。代码场景里这相对容易,有编译器兜底;开放场景里没有标准答案,评判更难,也更依赖模型自身的校准,这时候模型的"自知"就值钱了。
校准过度和校准不足都危险。过度怀疑会让 Agent 卡在循环里不敢前进,不足怀疑会让它带着错误狂奔。找到这个平衡点,是自我评判工程化的核心。智谱把记忆、学习、评判三块并列为下一步,说明它眼中的全自治不是单点突破,而是三块能力的协同成熟。任何一块掉队,7×24 都只是PPT里的口号。
今天能用上多少:三道坎对应的现状水位
三道坎是远期目标,但今天并非一无所有,看清现状水位才能合理期待。记忆方面,模型靠超长上下文窗口能撑住单次长任务,跨会话的经验留存还很弱,所以今天适合"一次性交待清楚"的任务,别指望它记得上个月的偏好。持续学习方面,微调和企业知识库能补一部分,但模型不会从自己执行里自动长本领,仍需人工喂反馈。
自我评判方面,代码场景最成熟,编译器能兜底对错,所以编程 Agent 最可用。开放场景的评判还在早期,模型容易自信地错,所以今天要把 Agent 关在有人复核的环里。把这些水位拼起来,结论是:中短程、可验证、有护栏的任务,现在就能用;超长程、开放式、无人盯的任务,还要等三道坎再成熟。
对企业,合理的姿势是先用现状水位里的那部分,把能自治的环节自治起来,把不能的留人把关。别被 7×24 的愿景带偏节奏,今天的 Agent 是助手不是替身。智谱把三道坎列为下一步,等于公开承认现在到全自治还有距离,这种坦诚反而让当下的可用能力更可信,选型时该按今天的水位下注。
行动建议
目前,智谱AI已经在云巴巴平台上线。在云巴巴,你可以横向对比智谱AI与同类产品的能力与价格,找到最适合你业务场景的AI解决方案。如果你正在评估大模型选型,或者想了解这款产品能为你省多少成本,云巴巴提供免费的产品咨询和方案对比服务。访问云巴巴,让专业顾问帮你做决策。


Qoder 知识引擎把一次性的项目搜索转成可复用、会进化的工程能力。本文拆解知识卡如何把工程语义变成 Agent 可消费的结构化上下文,并结合 SWE-bench Pro 实测,讲清它为何能提升任务得分、压低成本波动。

Qoder 用 ComputerUse 跑通自主迭代 Agent,靠 Goal 模式、自验证、回归守卫与项目记忆搭成自进化闭环,让不熟技术栈的人也能交付生产级软件,评测优于 Codex。

QoderWork 上线意识功能,由记忆、反思、技能进化组成闭环,让 AI 助手跨会话记住偏好、主动忘记过时内容、把高频流程固化为本领,额外成本仅主对话百分之五。

Qoder 的工程实践显示,当 AI 产出超过 Token 成本,瓶颈从模型转到人的精力。本文讲清三层委派、睡后 Token 与 Harness 平台,帮研发团队把人前移到决策位。

Qoder 全系夜间折扣上线,每晚十点到早八点切 Qwen3.7 低至两折,模型能力不变。Desktop、CLI、QoderWork、QoderWake、Cloud Agents 各自适合夜间无人值守场景,把大任务放心交给夜里。