
免费模型赛道又卷起来了,这次卷的是把活干完。Agnes 3.0 Flash 9 月初悄悄上线,官方定位一句话:面向 Agent 编程与工具驱动任务。之前 2.x 系列卷聊天和写代码,3.0 卷的是接到任务能不能真的干完、干对——任务执行减少话说完了活没干,工具编排少瞎调工具少进死循环,上下文遵循长任务不跑偏不漏要求,可信交付不假装干完不编结论。能力配置上文本加图像 URL 输入,Function Calling、Thinking 模式齐活,OpenAI 和 Anthropic 双协议兼容,最关键的官方已确认免费 key 就能体验。一个免费模型到底能不能干 Agent 的活,四场景实测给答案。
从 2.0 到 3.0 卷了什么

时间线理一下:5 月 26 日 2.0 首发,256K 上下文起步;6 月 1 日全模态免费,API 长期免费首周文本 1T tokens;7 月 13 日 2.5 卷 Coding,SWE-bench 从 72.4% 升到 75.6%,SWE Atlas 近翻倍;9 月 3.0 卷 Agent 执行,规划调用确认全链路。一句话总结:2.0 送免费,2.5 卷代码,3.0 卷执行。这条迭代路线的意思是,免费池子里的模型正在从聊天玩具升级成能编进生产流程的工种——每次升级的方向都踩在开发者的真实痛点上,这种迭代节奏本身就是选型的加分项——对开发者,这意味着容错池、备用线、批处理这些吃量的场景多了一个零成本选项。
四场景实测:快而且听话
实测环境 Mac 直连 API,四个基础 Agent 场景加同 key 同题的 2.5 对照。基础问答:六秒半答对且不啰嗦。Function Call:一点五秒正确调 get_weather 查上海,零废话。工具结果编排:三点九秒拿到天气 JSON 直接总结收工,没有重复调用——这是最典型的一项,某些模型拿到工具返回会忍不住再调一遍工具,3.0 没有。代码指令:六点六秒,说只要代码就真只给代码。
对照项:2.5 同题答案也对,但思考了 150 tokens 才开口,用时 52 秒;3.0 内置轻量思考(用量里能看到 reasoning_tokens)但输出极克制,六秒半交卷。这个差距在 Agent 高频调用场景里会被放大成倍数——一个任务链跑二十次工具调用,每次省四十秒就是十几分钟。两个体感总结:一是听话,指令边界守得好,不要解释就真不给解释;二是不糊弄,工具调用干净利落不折腾。这两个特质放在 Agent 场景里,比单纯的参数规模更能决定好不好用。诚实声明:单次采样图个量级,官方 benchmark 还没放,目前全网自称 3.0 深度评测的都可以先划走。
三十秒接入指南

五步接完。头一步 platform.agnes-ai.com 注册建 API Key,免费无需信用卡。第二步 Base URL 认准 apihub.agnes-ai.com/v1,国内直连同域名 .cn 也通,另有 CN 站 api.agnes-ai.cn/v1。第三步注意两站账号不互通、key 不通用——追求国内低延迟就在 CN 站单独注册拿一把 key,哪边快用哪边。第四步模型名 agnes-3.0-flash,SDK 换 base_url 即用,Anthropic 协议走 /v1/messages。第五步要深度推理,请求里加 chat_template_kwargs 的 enable_thinking 设为 true。
代码就五行:用 OpenAI SDK 初始化 client,api_key 填你的 key,base_url 填 https://apihub.agnes-ai.cn/v1,create 时 model 用 agnes-3.0-flash,messages 里放你的问题,打印 choices 的 content 即可。一个小坑提前说:两站的 key 长得一样但不通用,混用直接报无效的令牌——配置时按域名配对 key 就不会踩。
和其他免费模型比处于什么位置
免费模型这个池子里,3.0 的位置怎么摆。跟自家的 2.5 比:能力方向不同——2.5 强在代码(SWE-bench 75.6%),3.0 强在 Agent 执行链路;速度差距明显(同题 6.5 秒对 52 秒),高频工具调用场景 3.0 优势大,深度代码任务 2.5 仍更对路。跟其他家的免费档比:多数平台的免费额度有限次或限时,Agnes 这边官方口径是免费了就不再收费,长期成本确定性高一截;双协议兼容在免费模型里不多见,OpenAI 和 Anthropic 生态的项目都能直接切过来,迁移成本接近零。
组合建议按任务分层:日常问答和轻量工具调用走 3.0,代码生成走 2.5,两条线都在免费池里,等于零成本覆盖了开发者的两大高频场景。再往上,需要高阶推理能力的攻坚任务才动用付费旗舰——免费层把量撑住,付费层只花在刀刃上,这套分层结构是眼下性价比颇高的模型配置打法。
什么时候不该用免费模型

免费不是什么都能接的答案,三类场景建议直接绕开。涉及敏感数据的任务:客户信息、商业机密、未公开的财务数据,走外部 API 前先过合规审查,免费档的服务条款通常对数据处理承诺更弱,敏感场景用企业级付费方案更稳。对稳定性要求极高的生产链路:免费服务可能限流调整,订单处理、实时客服这类不能中断的业务,付费主力加服务等级协议才是正解。需要长期技术支持的场景:免费档一般没有专属支持渠道,出问题靠自己排查,团队没有这层能力储备的,别把关键链路押上去。把边界画清楚,免费模型就永远是增益而不是隐患。等官方榜单和更多第三方数据出来,这个免费池子的座次还会变,但「零成本先试、按需分层」的用法策略,什么时候都不吃亏。
免费背后的问题与边界
免费模型要不要担心稳定性和数据安全,两个实际问题提前想。稳定性:免费服务可能限流、排队甚至调整策略,auto-router 的价值正是在此——主力模型出问题时自动切到备用线,3.0 这类免费模型把备用成本压到零,但别把关键业务全押在免费档上,生产链路要有付费主力兜底。数据安全:第三方 API 的数据处理策略要过一眼——敏感材料、客户数据、商业机密,走任何外部模型前先确认合规口径,拿不准的就脱敏或本地化,这条对免费和付费模型一视同仁。边界想清楚,免费才是纯收益:它最适合的是开发测试、批量低敏任务、容错备份这三个位置,主力攻坚仍交给付费旗舰——组合着用,成本和能力两头都占。
免费模型的正确用法
3.0 太新,第三方测评暂时为零,能参考的只有 2.x 口碑:问答出图够用、2.0-Flash 在 PinchBench 拿过 60.9% 压过 GPT 5.4 一头、开发者社区公认免费 API 量大管饱。底子能打,3.0 又把火力对准 Agent 执行,方向是对的。对拿免费模型凑 auto-router 容错的开发者,实际体验是反应快、输出干净、工具调用不糊弄,可以直接挂进池子当二号线。
给三类人的建议。个人开发者:零成本把玩 Agent 开发全流程,Function Calling 和双协议都齐,学习成本几乎为零。小团队:开发测试环境全量切免费模型,生产环境留付费主力加它做容错备份,成本结构立省一截。批量任务处理:清洗、分类、摘要这类高频低风险任务,快和听话比聪明更重要,3.0 的特性正好匹配。等官方榜单放出来值得再跑一轮长测,但就冲免费加执行稳这两条,现在挂进池子没有悬念——免费模型早就不是只能聊聊天的年代了,这次是真的能干活。开发者花十分钟接入,就能给工具链多添一条零成本备用线,这笔账怎么算都划算。
如果你正在评估企业级 AI 模型选型与多模型路由方案,可以联系我们。目前相关产品与实施服务已经在云巴巴平台上线,在那里你还能横向对比更多同类方案,按调用规模和场景需求找到匹配的组合。


2026年9月22日由阿里云主办的2026云栖大会在杭州开幕,云巴巴作为阿里云MaaS生态伙伴受邀出席;9月23日云巴巴首席AI架构师倪江玮在【智启新程:AI驱动创新企业】分论坛发表《从账号到产能,千问办公落地真实场景的FDE实践》主题演讲,系统呈现云巴巴推动千问办公进入企业真实场景的FDE方法论与三阶段六模块交付体系。

报销解决员工垫付回款,结算解决合作方按成果取酬,两者解决的问题不同。本文对等说明两种路径的形态、报销路径适合的场景与范围、平台结算路径的适用条件、四处关键差异以及按条件做选择的判断方式。

责任划分的起点是关系性质。本文说明标准劳动关系、不完全劳动关系与民事合作关系的区分依据,用工责任与控制环节的对应关系,平台承担的审核与留存义务,人员自身应尽的信息真实性义务以及争议的处理路径。

对公划转、个人收款、托管账户与批量代付各有适用条件。本文对等说明四类通道的形态、对公收款的适用场景与前提、个人收款的限制与维护要点、通道选择要看的四类条件以及合规核对的三条线索。

批量发放出现退回是规模上去之后的常见情形。本文说明退回的三类直接原因、人员与账户的分层核对顺序、退回之后的处理顺序与时限安排、减少同类退回的四项前置动作以及台账应保留的字段。