立即咨询

电话咨询

微信咨询

立即试用
商务合作

GPT-5.6 三模型 Sol/Terra/Luna 实测

2026-07-31

 

 

OpenAI 这回总算把憋了很久的 GPT-5.6 全家桶端出来了,正好赶上对手 Claude Fable 5 风头正盛。三款模型分别叫 Sol(太阳)、Terra(地球)、Luna(月亮),名字挺浪漫。

 

 

全量开放是 7 月 9 日,我这一周基本都泡在 Codex 里拿这三个模型干活,下面聊聊真实体感。

 

三档到底怎么分

 

官方的说法是:Sol 负责天花板,Terra 管日常,Luna 管省钱。他们还特意点明,5.6 只是代号,Sol、Terra、Luna 会长期保留、各走各的进化路线,往后可能就是中杯、大杯、超大杯那套打法了。

 

 

定价反而成了亮点

 

这代价格收得很克制,能力和 GPT-5.5 比明显涨了,钱包却没跟着涨:旗舰档不提价,中端直接腰斩,入门更是打到两折。

 

 

横向看 Claude Fable 5 标价 10 美元和 50 美元,Sol 这边的性价比就显出来了。摆明了是冲着 Anthropic 去的,效果也立竿见影。5.6 开放当晚,Claude 那头连夜给用户重置了额度。

 

跑分我更信第三方的

 

官方发布会上的数字先放一边,我更认 Artificial Analysis(业内相对中立的跑分站)的数据。下面三张图从智力、编程、Agent 三个维度给这代定了位。

 

先是 Intelligence Index(综合智力指数),它聚合了 GPQA Diamond、Humanity's Last Exam、Terminal-Bench、SciCode 等 9 项高难度评测,覆盖推理、知识、数学、编程,相当于模型的「综合素质高考分」。

 

 

这一项适合拿来做整体规划、深入调研。5.6 Sol 已经非常贴着 Fable 5,只差 1 分,但成本只有人家一半(当然纯比效果确实还差一口气)。

 

再看 Coding Index(编程指数),由 SWE-Bench-Pro-Hard、Terminal-Bench、SWE-Atlas-QnA 三个子测试等权平均,全是程序员真实场景,比刷题式跑分含金量高。

 

 

这是程序员最在意的指标:5.6 Sol 把 Fable 5 干掉了,而且三款模型全站在帕累托最佳拐点上,也就是效果价格最优。可以说 GPT 头一回在编程上压过 Claude,这也是 Fable 5 一再延期还加送 token 的主因。另外 5.6 Luna 和 GLM-5.2 价格基本持平,得分却高一截,重性价比的直接选 Luna 就行。

 

 

压轴是 Agentic Index(智能体指数),衡量模型当「数字员工」的本事:自主规划、调工具、跨多步跑长链路任务,正是这代竞争的主战场。

 

 

论分,5.6 Sol 还是顶格;而 5.6 Luna 成了整条帕累托曲线上斜率最大的点,翻译成人话:每多花一块钱,它涨的分最多。

 

还有两个新玩法值得一提:max 推理档让 Sol 在难题上想得更久更深;ultra 模式直接派出多个子 Agent 并行。我用 ultra 跑过一次复杂任务,看它同时开四条工作流(当然 token 也烧得飞起)。

 

我实际用下来的感受

 

跑分之外,说点看不出来的。

 

长任务终于扛住了。以前跑长链 Agent,梳理大代码库、重构、跑测试一条龙,模型常干到一半「失忆」或开始敷衍,你得全程盯着。Sol 是真接了活不撒手:自己定计划、调工具、查结果,中途报错会主动回头排查,几小时的任务一口气跑完,我拿手机远程偶尔瞄一眼就行。最长一次跑了 12 小时,还是额度耗尽才停。

 

它不只是能干活,是真「懂」项目。有次我把一个被别的模型反复拷打过的项目丢给 Sol,它直接从架构层面彻底优化,还抛出一堆我从没想过的问题。看完方案那刻,恍然加「真牛」两种感觉一起上来,它已经不是执行我的想法,而是在补我的盲区。

 

网络安全同理:拿它做代码审计和漏洞排查,它能沿调用链一路追下去,把权限校验缺口、注入点这类藏得深的问题挖出来,还顺手给修复方案和验证步骤。这也是 GPT-5.6 没第一时间发布、被美国政府审批几天才面向公众的原因。

 

提示词和 skills 可能没那么重要了。不少之前的提示词、skills「失效」了,不是不管用,而是模型能力上来后,那些规范行为的工具反而成了累赘。比如业界出名的 superpowers,Claude 时代的王者,5.6 出来后很多人发现它反倒成了 token 爆炸的元凶。

 

当然缺点也有:Sol 烧额度真猛。我用 GPT-5.6 Sol Ultra 跑俩任务,合并 10 份 PDF、整理 700 个 Markdown 文件,当天额度直接清零,等于「Plus 订阅 = 每天允许欣赏模型 12 分钟」。好在 OpenAI 发布 48 小时后临时取消 5 小时限制,一周内给付费用户重置至少五次额度,还承诺优化推理效率后同额度可用量再加 10%。额度不宽裕就别轻易开 Ultra。

 

几句题外话

 

模型之外,再说点感想。

 

AI 时代用户没什么忠诚度,哪家好用就用哪家。5.6 出来前我一直深度用 Claude,Fable 5 的效果让我吹了很久;5.6 一出我立马换 Codex 还充了 Pro。这不是善变,是与时俱进,工具就是工具,别谈感情。

 

点子比能力更值钱了。5.6 出来后,脑子里又冒出一堆想做的小项目。这年代能力能按 token 租,想法没人替你出。有想法就有收获。

 

为 AI 付费不亏。哪怕浪费点额度也不是打水漂,每次「浪费」都在指你未来的方向。

 

上面这些关于 GPT-5.6 的实测和选型思路,其实也是很多团队当下在跟进的方向。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。

热门数字化产品

橙色云CRDE智橙协同设计研发平台橙色云CRDE智橙协同设计研发平台是SaaS云原生平台,整合云CAD、项目管理、BOM管理等多功能,支持多终端、跨地域协同工作。它以云PLM与云CAD一体化为核心,提供一站式产品创新解决方案,推动企业数字化转型,实现高效、低成本研发设计。
火山引擎云手机火山引擎云手机是结合云计算和超低延迟音视频传输技术的跨终端虚拟云手机服务,在云端最大化地模拟真实手机的环境和性能。为客户提供稳定可靠的云机和安卓实例,以及高品质、低延迟的互动和串流技术,同时支持客户开发自定义业务逻辑的云服务。
阿里云无影云电脑阿里云无影云电脑(WUYING Workspace)是一种易用、安全、高效的云上电脑,支持快速便捷的创建、部署和统一运维管控。自带多重安全管控能力,支持随时随地访问,资源灵活弹性。广泛应用于安全办公、协同研发、教育实训、私域运营、分支门店、客服办公等。
腾讯电子签腾讯电子签是一款为企业及个人提供安全、便捷的电子合同签约及证据保存服务的产品。 您可以在实名认证的前提下,与约定方完成线上签约,并将签约过程进行存证保全以确保签约公信力。 腾讯电子签致力于降低您的运营成本,提升多端签署效率。
阿里云云服务器ECS云服务器 ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,助您降低 IT 成本,提升运维效率,使您更专注于核心业务创新。 专业的售前技术支持,协助您选择最合适配置方案
为你推荐
三个店铺三套报表怎么办?家居卖家的生意地图整合记

以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

2026-08-13
报价整理太慢怎么办?机械外贸用Accio Work备好询盘弹药

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

2026-08-13
客服离职交接乱怎么办?知识库沉淀让Accio Work无缝顶岗

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

2026-08-13
上新总拖一周怎么办?服装卖家用Accio Work当天铺完三平台

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

2026-08-13
询盘半夜来怎么办?一家五金厂用Accio Work接住时差商机

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。

2026-08-13
查看更多