
把 Sonnet 5 摆上秤:一笔 Agent 账
Anthropic 最新推出的 Claude Sonnet 5,官方的说法是史上最会当 Agent 的一代 Sonnet:能自己列计划、会调用浏览器和终端这类工具,价格却贴近部分 Opus 级 Agent 的表现。和 Sonnet 4.6 比,官方强调它在推理、工具使用、编码和知识工作上都有明显长进。
先交代测试口径:本轮跑的是 Sonnet 5 的思考(高投入)配置,即 claude-sonnet-5-thinking,重点考察中文场景下的综合能力,题目覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent 工具调用和 coding 八个板块。官方主推的长程 Agent、代码协作、电脑操作和安全表现,建议结合文末官方评测一起看。
这版思考配置的实测盘面:
- 题量约 1.5 万 - 综合准确率 70.8% - 单次调用平均耗时 20 秒 - 单次调用平均 token 1590 - 每千次调用花费约 93.7 元
先看官方基准
Anthropic 在官方博客里把 Sonnet 5 拉来和 Sonnet 4.6、Opus 4.8 同台比过:

- SWE-bench Pro:本代 63.2%,高于 Sonnet 4.6 的 58.1%,但低于 Opus 4.8 的 69.2%。 - Terminal-Bench 2.1:达到 80.4%,明显甩开 Sonnet 4.6 的 67.0%,逼近 Opus 4.8 的 82.7%。 - Humanity's Last Exam:无工具时 43.2%(4.6 为 34.6%,Opus 4.8 为 49.8%);带工具时 57.4%,贴近 Opus 4.8 的 57.9%,高于 4.6 的 46.8%。 - OSWorld-Verified:81.2%,高于 4.6 的 78.5%,接近 Opus 4.8 的 83.4%。 - GDPval-AA v2:得分 1618,高于 4.6 的 1395,也略高于 Opus 4.8 的 1615。
Anthropic 还画了 Sonnet 5、Sonnet 4.6、Opus 4.8 在不同 effort 档位下的成本曲线:结论是 Sonnet 5 比 4.6 铺开了更宽的成本-性能区间,中等 effort 下性价比提升明显,更高 effort 时部分任务能贴住 Opus 4.8。

安全一项,官方称 Sonnet 5 整体比 4.6 更稳:Agent 场景里更会拒掉恶意请求、也更能顶住 prompt injection,幻觉和迎合倾向更低,自动化审计里的不良行为率也更低。不过官方也坦承,它在那项审计里的不良行为率仍高于 Opus 4.8 和 Claude Mythos Preview。


网络安全方面,Anthropic 明确表示 Sonnet 5 并没有被专门训练去做网络安全任务。它能应付一些常规、无害的网络活儿,但在危险能力评估里明显弱于 Opus 4.8 和 Mythos 5;官方举例,Firefox 漏洞利用评估中 Sonnet 5 的完整成功率为 0.0%,部分成功率只是略高于 4.6。鉴于它比前代在这类任务上稍强,Anthropic 已默认打开网络安全防护。
横向放到大模型盘子里
把 claude-sonnet-5-thinking 放进当前主流格局,从几个角度拉一拉:

*数据来源:非线智能 ReLE 评测*
- 和 Opus 及头部闭源比:对照 claude-opus-4.8-thinking(74.7%,19 秒,238.2 元),Sonnet 5 Thinking 低 3.9 个百分点、耗时接近、但花费低约 61%;对照 gpt-5.5(75.3%,15 秒,158.5 元)和 gemini-3.5-flash(73.9%,13 秒,151.2 元),总分差得更明显,不过单次花费也更便宜。 - 同价位段:claude-sonnet-5-thinking(70.8%,93.7 元)落在 90 至 110 元/千次一带,同区间还有 qwen3.7-max(76.9%,99 元)、kimi-k2.6(72.9%,100.4 元)、claude-opus-4.8(71.5%,99.4 元)、gpt-5.2-high(67.3%,94.1 元)和 ERNIE-5.0(67.2%,89.2 元)。只看中文综合准确率,它并不领先,明显低于 qwen3.7-max,也低于 kimi-k2.6 和 Opus 4.8 的非思考模式。 - 速度是个亮点:平均 20 秒,比 qwen3.7-max(51 秒)、kimi-k2.6(175 秒)、gpt-5.2-high(36 秒)都快,只是慢于 claude-opus-4.8 非思考(9 秒)和 gpt-5.5(15 秒)。 - 往下看低价替代:qwen3.5-plus(73.3%,22.9 元)、qwen3.7-plus(73.5%,31.7 元)、kimi-k2.7-code(72.6%,49.7 元)、deepseek-v4-pro(71.7%,54.3 元)都用更低成本拿到更高中文综合准确率。
在 Anthropic 自家序列里,Sonnet 5 Thinking(70.8%,第 23 位)低于 Opus 4.8 非思考(71.5%,第 18 位)、高于 Opus 4.6(70.0%,第 28 位);而 Opus 4.8 Thinking 仍以 74.7%(第 7 位)坐顶。相比 Sonnet 4.5 Thinking(66.2%,第 49 位)和 Opus 4.5(64.2%,第 62 位),它的位置明显上移。它更像是 Anthropic 在中高成本区间补的一块 Agent 型拼图,而非用来顶掉 Opus 线的最高能力。
放到近期新模型里,它低于 qwen3.7-max、doubao-seed-2-1-pro-260628、gpt-5.5、claude-opus-4.8-thinking、gemini-3.5-flash、glm-5.2、kimi-k2.6 等,但与 Kimi-K2.5-Thinking(70.8%)基本持平,并略高于 qwen3.6-plus(70.7%)、GLM-5.1(70.7%)和 Qwen3.5-27B(70.6%)。
开源对闭源这边:闭源阵营里它高于 Doubao-Seed-2.0-lite(70.5%)、claude-opus-4.6(70.0%)、GLM-5-Turbo(69.3%)等,但低于 qwen3.7-max、gpt-5.5、gemini-3.1-pro-preview、claude-opus-4.8-thinking、gemini-3.5-flash、claude-opus-4.8 这些头部闭源。开源阵营选择更密:qwen3.5-plus(73.3%,22.9 元)、kimi-k2.6(72.9%,100.4 元)、glm-5.2(73.0%,110.5 元)、deepseek-v4-pro(71.7%,54.3 元)、Qwen3.5-122B-A10B(70.9%,32.3 元)已在 70% 到 73% 区间扎堆。真正形成成本压力的是 qwen3.5-plus、deepseek-v4-pro 和 Qwen3.5-122B-A10B,它们以明显更低成本拿到更高或接近的总分;kimi-k2.6 与 glm-5.2 的意义更多在于说明,同一分数段内开源模型已经很丰富了。
和上一代比,账怎么变
把 claude-sonnet-5-thinking 与 claude-sonnet-4.5-thinking 对照,变化很直接:总分涨、速度提、成本降,增量集中在 coding、Agent 工具调用和推理数学,部分中文垂类反而回调。


*数据来源:非线智能 ReLE 评测*
*输出价格单位:元/百万 token*
- 总分从第 49 位升到第 23 位,准确率 66.2% 涨到 70.8%(+4.6 个百分点)。 - coding 是最大的一块:52.1% 冲到 70.0%(+17.9 个百分点),和官方面向编码与 Agent 工作流的定位严丝合缝。 - Agent 工具调用从 58.4% 到 66.5%(+8.1 个百分点),工具选择、任务拆解、执行链路都更适合塞进 Agent 系统。 - 推理与数学从 78.0% 到 82.4%(+4.4 个百分点),多步推演和复杂题拆解确有进步,只是增量不如 coding 和 Agent 醒目。 - 中文垂类做了取舍:医疗与心理健康 79.1% 降到 76.6%(-2.5),语言与指令 64.2% 降到 62.4%(-1.8),法律与行政 81.0% 降到 79.3%(-1.7),金融 78.0% 降到 76.5%(-1.5),教育 54.9% 降到 54.7%(-0.2)。也就是说,Sonnet 5 Thinking 不是在所有中文任务上同步变强,而是把重心更明显地压向代码、工具和推理。
成本与速度这一项改善很猛:平均耗时 39 秒压到 20 秒(少 19 秒),平均 token 3070 降到 1590(约 -48%),输出价格 108.75 降到 70.0 元/百万 token。折算下来每千次调用花费从 305.1 元掉到 93.7 元,差不多是上一代的三成。
Sonnet 线自身的成本效率变化最醒目:claude-sonnet-5-thinking(70.8%,93.7 元)对比 claude-sonnet-4.5-thinking(66.2%,305.1 元),提 4.6 个百分点、花费降到约三成。这说明 Sonnet 5 不只是能力补强,也把 Anthropic 产品线里思考档的使用成本拉了下来。
上面这些评测视角,也是大家在挑模型时容易忽略的成本账。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。


以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。