Navigator n2是Yutori于2026年8月26日发布的电脑操作(computer-use)模型,参数规模270亿,定位是把桌面自动化的成本压到日常业务可负担的水平。与前代n1和n1.5专注浏览器操作不同,n2是通用的电脑操作模型,能够驱动完整的桌面环境——原生应用、终端与浏览器都在覆盖范围内,且支持Linux、macOS与Windows三大平台。这款模型的核心设计思路在于「选对接口」而非「模仿人类操作」。传统的纯图形界面智能体会用人类的慢方式做事,在可以一条命令解决的任务上反复点击,既耗时又烧token;但现实中也有大量任务无法简化为API调用,原生应用、实时网页与视觉状态仍然需要真实的点击操作。n2的训练重点是让模型在单个任务内部动态判断该用哪种接口:图形界面、命令行、工具还是直接写代码,并在长任务中保持策略稳定,避免在低效界面上反复操作或频繁切换工具却推不动任务。官方公布的基准成绩包括:OSWorld 2.0得分65.2%、OSWorld-Verified得分85.3%、MyPCBench得分82.6%、MacAgentBench得分83.1%、WeaveBench得分70.3%,其中后四项均超过官方博客中列出的其他对比模型。需要说明的是这些均为Yutori自报成绩,横向解读时应保持谨慎。训练数据的生产方式也值得关注:Yutori在过去两个月生成了超过1万个覆盖数百款应用的任务,并让智能体参与任务探索、验证器生成与失败案例分析,把新发现的问题加入下一轮训练,形成「模型生成训练任务再训练更强模型」的循环。定价方面,输入每百万token 0.5美元、缓存输入0.05美元、输出4美元;在OSWorld 2.0测试中官方给出的平均单任务API成本为1.46美元。模型通过Yutori API提供,同时也驱动其消费级产品;发布公告中未宣布开源权重计划。
📋 技术规格
| 厂商 | Yutori |
|---|---|
| 模型分类 | 多模态理解 |
| 参数规模 | 270亿(27B) |
| 上下文窗口 | 未公开 |
| 最大输出 | 未公开 |
| 知识截止 | 未公开 |
| API定价 | 输入: 0.5美元/百万tokens(缓存输入0.05美元/百万tokens)输出: 4美元/百万tokens |
⭐ 核心能力详解
270亿参数,专为电脑操作场景设计
覆盖Linux、macOS与Windows三大桌面平台
OSWorld-Verified得分85.3%,MacAgentBench得分83.1%(均为自报)
图形界面、命令行、工具与代码在单任务内交替使用
输入0.5美元、输出4美元每百万tokens,成本定位明确
训练数据由智能体参与生成,形成任务生成与模型训练的循环
🎯 典型应用场景
重复性的仪表盘数据抓取与报表整理
跨应用的办公流程自动化
软件测试中的界面操作与回归验证
运维场景的终端命令执行与排查
内容平台的批量信息录入与更新
需要驱动原生桌面应用的业务流程自动化
💪 技术优势与差异化
- 交替使用图形界面与命令行,比纯GUI方案更快也更省token
- 覆盖三大桌面平台,不局限于浏览器场景
- 单任务成本控制在1.46美元量级,让低价值重复任务具备自动化经济性
- 27B参数规模在电脑操作类模型中属于轻量档,推理成本优势明显
- 缓存输入价格为常规输入的十分之一,重复上下文场景成本可控
- 长任务的接口切换策略经过专项训练,稳定性优于通用模型硬做
⚠️ 使用局限与注意事项
- 所有公布基准成绩均为Yutori自报,缺少独立第三方验证
- 发布公告中未宣布开源权重计划,仅通过API提供
- 上下文窗口与最大输出长度官方未公开
- 电脑操作类任务的成功率受目标应用界面变化影响,稳定性需持续监控
- 涉及真实系统操作,权限边界与安全沙箱需使用方自行设计
- 厂商为新兴公司,长期服务稳定性与生态成熟度需观察
💰 价格分析与成本建议
Navigator n2的定价为输入每百万token 0.5美元、缓存输入0.05美元、输出4美元,官方在OSWorld 2.0测试中给出的平均单任务API成本为1.46美元。这个数字比看起来更有意义,因为它把定价从抽象的token单价换算成了业务可直接理解的单位——每完成一个桌面任务的花费。以此为参照做决策:一个原本需要人工花15分钟完成的重复性操作,如果自动化后单次成本约1.46美元,那么在人力成本高于每小时6美元的场景下就已具备经济性,这意味着大量此前「不值得自动化」的长尾任务进入了可行区间。成本结构上还有两点值得利用:缓存输入价格是常规输入的十分之一,重复执行同类任务时把固定的环境描述与操作规范稳定在提示前部可显著降本;输出价格是输入的8倍,因此控制模型的冗余思考输出比压缩输入更能影响账单。需要提醒的是1.46美元是特定基准下的平均值,实际任务的复杂度分布会让成本上下浮动。
👥 适用人群与企业
业务流程自动化团队、软件测试工程师、运维自动化开发者、需要跨应用数据整合的运营团队、构建智能体产品的技术团队、探索桌面自动化的中小企业
🏭 行业适配度评估
跨平台界面回归测试与运维自动化是最直接的落地场景
⚠ 必须在隔离沙箱中运行并建立操作审计
多后台数据抓取与批量信息录入,尤其适合无开放接口的系统
⚠ 目标系统界面变更会导致流程失效,需定期回归
多平台商品信息维护与订单处理的重复操作自动化
⚠ 涉及交易操作的环节应保留人工确认关卡
报表整理、资料归集等重复性桌面工作可自动化
⚠ 客户资料处理需评估数据出域风险
内部系统的数据核对与报表整理存在自动化空间
⚠ 金融系统操作权限管控极严,且厂商合规信息公开有限,落地门槛高
理论上可用于内部管理系统的重复操作
⚠ 涉及患者数据的系统不宜授予第三方模型操作权限
🔧 技术架构解析
| 模型定位 | 270亿参数的电脑操作模型,前代n1与n1.5专注浏览器操作,n2扩展为通用桌面环境操作 |
|---|---|
| 接口策略 | 训练重点是让模型判断何时使用图形界面、命令行、工具或代码,并在长任务中保持策略稳定,避免低效重复操作与无效工具切换 |
| 平台覆盖 | 支持Linux、macOS与Windows三大桌面平台,可操作原生应用、终端与浏览器 |
| 训练数据 | 过去两个月生成超过1万个覆盖数百款应用的任务,智能体参与任务探索、验证器生成与失败案例分析,新问题进入下一轮训练形成闭环 |
| 基准成绩 | OSWorld 2.0 65.2%、OSWorld-Verified 85.3%、MyPCBench 82.6%、MacAgentBench 83.1%、WeaveBench 70.3%,均为厂商自报 |
| 接入方式 | 通过Yutori API提供,采用兼容主流协议的聊天补全接口;同时驱动Yutori自有的消费级产品 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(Yutori未在发布信息中明确说明API交互数据是否用于模型训练) |
|---|---|
| 合规认证 | 未公开 |
| 数据驻留 | 未公开(通过Yutori API提供,具体区域部署选项未披露) |
| 加密方式 | API调用采用HTTPS/TLS传输加密 |
⚔️ Yutori Navigator n2 与同类智能体模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| 通义千问Qwen3.8-Flash | AndroidWorld得分84.5,移动端界面操作能力强 | 聚焦移动端场景,桌面原生应用覆盖较弱 |
| IBM Granite 4.2 | Apache 2.0开源,经智能体强化学习具备终端操作能力 | 未针对跨平台桌面GUI操作做专项优化 |
| 通用前沿大模型 | 综合能力强,可处理操作之外的推理任务 | 单任务成本显著更高,缺少接口切换的专项训练 |
- 图形界面与命令行交替使用,找出完成任务的最短路径
- 覆盖Linux、macOS与Windows三大桌面平台
- OSWorld 2.0平均单任务成本1.46美元,成本优势明显
- 27B轻量参数规模带来更低的推理开销
🏢 同厂商模型矩阵
Yutori Navigator 系列模型定位
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Yutori Navigator n2当前 | 通用电脑操作 | multimodal | 27B参数,跨三大桌面平台,OSWorld-Verified 85.3%(当前模型) |
🧭 选型决策指南
可驱动原生应用与浏览器,覆盖无API的系统
三大桌面平台均在支持范围内
单任务成本约1.46美元,长尾任务自动化具备经济性
所有公布成绩均为厂商自报,建议用自有用例复测
发布公告中未宣布开源计划,仅通过API提供
权限风险高且厂商合规信息公开有限
🏆 真实使用案例
📌 某运营团队用Navigator n2做多平台数据汇总
📌 某软件团队用于跨平台界面回归验证
💬 用户真实评价
能在一个任务里既点界面又敲命令,这个设计比纯GUI的方案实用太多,很多步骤直接一条命令就过去了。
跨Windows和macOS做同一套流程验证省了不少事。不过基准分数都是厂商自己跑的,我们还是按自己的用例重新评估了一遍。
单任务一美元多的成本让很多以前懒得自动化的杂活变得值得做了。但模型是真的在操作系统,沙箱和权限这块必须自己搭好。
✅ 实践建议与使用技巧
💡 Prompt工程建议
显式提示优先使用命令行
对可以用命令完成的操作明确引导走终端,比图形界面点击更快且token消耗更少。
固定环境描述放在提示前部
系统版本、已装应用、操作规范等不变内容前置且保持稳定,才能命中缓存降低成本。
为长流程设置检查点
把长任务拆成若干阶段,每阶段结束要求模型汇报当前状态,便于失败时定位与续跑。
明确禁止操作的边界
模型会真实操作系统,在提示中显式列出禁止触碰的目录、应用与操作类型。
🔄 替代方案分析
开源权重支持本地部署,其中Granite 4.2的8B与30B经过智能体强化学习具备工具调用与终端操作能力。
AndroidWorld得分84.5,在移动端界面操作场景更专精。
这些模型在长程规划与复杂推理上能力更强,可作为编排层与操作模型配合。
多模态模型配合浏览器自动化框架即可覆盖纯网页场景,成本更低。







首页 







