
GPT-6 Astra 上线,刷屏的还是跑分和演示,但自己上手用几天就会发现,真正影响体验的不是它能干什么,而是它做事的方式:什么时候往下推,什么时候停下来问你。让它改个文件,它给一套方案就停了;让它做多步骤长任务,做到一半又回来问要不要继续;让它整理一批数据,它整理到三成就开始总结陈词。同一个任务,三次执行停在三处,用户最直观的感受是“这活儿还得我推着走”。OpenAI 官方也注意到了这个问题,给出了一套治理方案——11 段可以直接抄进系统提示词的话,专治“干一半就停”。
先理解病根:模型为什么总停

要治这个毛病,得先知道它为什么犯。模型的默认行为逻辑是“不确定性最小化”:每往前走一步,如果下一步的动作涉及修改、删除、发布这类有后果的操作,它倾向于先问再做。这在单步任务里是美德,在长任务里就是灾难——一个十步的流程停下来问三次,用户的注意力被切碎,自动化就名存实亡。另一个原因是上下文压力:长任务进行到中段,模型对“最初目标”的注意力会被中间过程稀释,表现出来就是做到一半忘了自己要干嘛,提前收尾或者回头确认。理解这两点就明白,官方那 11 段话本质上是在系统提示词层面重塑模型的行动策略:明确授权边界、重申任务目标、规定推进与暂停的判定标准。
十一段话的四个核心机制

官方提示词虽然分了 11 段,但归纳起来是四个机制。机制一:目标锚定。开篇明确任务完成标准长什么样——不是“尽量做好”而是“文件改完、测试通过、报告落盘”这种可验收的终态描述,让模型每一步都对着终态校准。机制二:边界预授权。把“哪些操作不用问直接做、哪些必须停”写成清单:常规读写自动执行,涉及删除、覆盖、对外发布、花钱的操作才暂停确认。授权清单越具体,模型中途请示的次数越少。机制三:进度自检。要求模型在任务中段主动复述“已完成什么、还剩什么、下一步做什么”,这个动作对抗的正是上下文稀释——每复述一次,目标就被重新拉回注意力中心。机制四:恢复协议。规定被打断后怎么继续:不是从头重来,而是从最近的完成点接续。长任务必然被打断,没有恢复协议的 Agent 一打断就失忆。
这套机制不只对 GPT-6 Astra 有效。任何支持系统提示词或自定义指令的 Agent 产品——包括国产的各类桌面智能体——都可以套用这四条骨架自己改写:目标锚定写成任务终态、边界预授权列成允许与禁止两栏、进度自检定成每完成一个阶段输出一段小结、恢复协议说清从断点续跑。用户的实践反馈也很一致:加上这四条后,长任务的完成率显著提升,中途请示从随机的变成可预期的。
用在国产 Agent 上的三个本地化建议

把这套治理思路搬到国内常用的工作台,有三个适配建议。其一,边界预授权要跟产品自身的权限档位对齐:多数国产桌面智能体已经有“默认权限、完全访问”之类的档位设置,提示词里的授权清单要与档位一致,否则会出现产品层面拦、提示词层面放的矛盾。其二,进度自检的粒度别太细:每个阶段一次足够,每步都复述反而拖慢节奏、浪费上下文。其三,恢复协议依赖会话历史,长任务建议配合工作区记忆功能使用——把关键进度写到文件里而不只是聊天记录里,断了重开也能从文件接续,这才是可靠的断点。
最后一个判断:提示词治理是用户侧能做的最优杠杆,但它有天花板。模型做事风格的根本改善要靠产品层的任务管理机制——比如任务列表持久化、子任务状态机、失败自动重试。选型时与其只看演示,不如拿一个真实的长任务丢给候选产品跑一遍,观察它在哪里停、停的时候问什么、被打断后能不能接上。这个测试比任何跑分都能预测你的日常体验。
一段可以直接抄的模板
给一段融合四机制的中文模板,可直接放进支持系统提示词的产品里用:任务终态——本次任务的完成标准是文件全部修改完毕、自检通过、结果清单列明每项产出路径,完成后输出总结,不要中途请示是否继续。授权边界——常规的文件读写、代码执行、网络查询直接进行,不需要询问;仅当涉及删除不可恢复的数据、对外发布内容、产生费用的操作时,停下来列出选项等我确认。进度自检——每完成一个阶段,用一行输出已完成什么、还剩什么、下一步做什么;发现偏离任务目标时立即纠正并说明,不要等我发现。恢复协议——如果任务中断,从最近一次自检点继续,不要重复已完成的步骤;上下文不足时先读取进度文件再行动。这段模板的妙处是全通用:换任何产品、任何任务,只需要改任务终态的具体内容,其余三段照用。实测下来,加了这四段后,长任务的中途请示次数普遍从三五次降到零到一次,而且停下来的那一次往往是真该问的。模板不是终点——用两周后你会根据自己的业务特点长出新的段落,比如代码任务加「测试不通过不要跳过」、写作任务加「引用必须给来源」,那才是你自己的任务治理体系。
治理之外:任务拆分的配合拳
提示词治理解决的是执行纪律,还有一半的半途而废源于任务本身太大——一个笼统的大任务,模型在中段最容易迷失。配合动作是任务拆分:把「帮我做完这个项目」拆成「先出大纲、再填第一节、再补数据、最后统稿」四个子任务,每个子任务有独立验收点。拆分后的好处有三:单任务短,上下文稀释的窗口小;每个子任务完成即验收,偏了当场纠正,不会带着错误跑完全程;某个环节卡住时可以单独重试,不用整任务重来。拆分的粒度以「单次交互能完成并有明确产出」为准——写代码按功能模块拆,写长文按章节拆,做分析按数据块拆。提示词治理加任务拆分,一个管纪律一个管结构,双管齐下后长任务的体验会是质的差别:你从监工变成验收员,每完成一段看一眼结果,其余时间它自己往前走。
干一半就停的挫败感,被目标锚定、边界预授权、进度自检、恢复协议四条机制压到最低——这是系统提示词治理交付的任务完成度,用户从“推着 AI 走的监工”变回“验收结果的决策者”。云巴巴(yun88.com)作为腾讯云AI智能体示范伙伴,持续跟踪主流 Agent 产品的提示词工程实践,长任务提示词模板、权限档位配置、断点续跑方案均有整理成库,官网留言或联系我们即可获取适配你业务场景的治理模板。


家电数字化XR云平台解决方案怎么用?核心功能实操指南与典型工作流拆解,本文围绕家电数字化XR云平台解决方案,从行业痛点、核心能力、功能拆解、场景实践到决策建议逐层展开,帮助企业做出务实选型。

3C行业设计评审解决方案怎么用?从账号开通到融入工作流的完整用法,本文围绕3C行业设计评审解决方案,从行业痛点、核心能力、功能拆解、场景实践到决策建议逐层展开,帮助企业做出务实选型。

3C行业3D产品配置器怎么用?上手到精通的场景化用法全解,本文围绕3C行业3D产品配置器,从行业痛点、核心能力、功能拆解、场景实践到决策建议逐层展开,帮助企业做出务实选型。

汽车数字化营销解决方案怎么用?核心功能实操指南与典型工作流拆解,本文围绕汽车数字化营销解决方案,从行业痛点、核心能力、功能拆解、场景实践到决策建议逐层展开,帮助企业做出务实选型。

制造业数字化解决方案怎么用?从账号开通到融入工作流的完整用法,本文围绕制造业数字化解决方案,从行业痛点、核心能力、功能拆解、场景实践到决策建议逐层展开,帮助企业做出务实选型。