立即咨询

电话咨询

微信咨询

立即试用
商务合作
Yutori

Yutori Navigator n2

Yutori Navigator n2是2026年8月26日发布的270亿参数电脑操作模型,可在Linux、macOS与Windows桌面环境中交替使用图形界面、命令行与代码完成任务

👁️
Yutori Navigator n2
由 Yutori 提供
👁️ 多模态理解 付费API

Navigator n2是Yutori于2026年8月26日发布的电脑操作(computer-use)模型,参数规模270亿,定位是把桌面自动化的成本压到日常业务可负担的水平。与前代n1和n1.5专注浏览器操作不同,n2是通用的电脑操作模型,能够驱动完整的桌面环境——原生应用、终端与浏览器都在覆盖范围内,且支持Linux、macOS与Windows三大平台。这款模型的核心设计思路在于「选对接口」而非「模仿人类操作」。传统的纯图形界面智能体会用人类的慢方式做事,在可以一条命令解决的任务上反复点击,既耗时又烧token;但现实中也有大量任务无法简化为API调用,原生应用、实时网页与视觉状态仍然需要真实的点击操作。n2的训练重点是让模型在单个任务内部动态判断该用哪种接口:图形界面、命令行、工具还是直接写代码,并在长任务中保持策略稳定,避免在低效界面上反复操作或频繁切换工具却推不动任务。官方公布的基准成绩包括:OSWorld 2.0得分65.2%、OSWorld-Verified得分85.3%、MyPCBench得分82.6%、MacAgentBench得分83.1%、WeaveBench得分70.3%,其中后四项均超过官方博客中列出的其他对比模型。需要说明的是这些均为Yutori自报成绩,横向解读时应保持谨慎。训练数据的生产方式也值得关注:Yutori在过去两个月生成了超过1万个覆盖数百款应用的任务,并让智能体参与任务探索、验证器生成与失败案例分析,把新发现的问题加入下一轮训练,形成「模型生成训练任务再训练更强模型」的循环。定价方面,输入每百万token 0.5美元、缓存输入0.05美元、输出4美元;在OSWorld 2.0测试中官方给出的平均单任务API成本为1.46美元。模型通过Yutori API提供,同时也驱动其消费级产品;发布公告中未宣布开源权重计划。

{'name': '跨平台桌面操作', 'desc': '支持Linux、macOS与Windows三大平台的完整桌面环境操作'}{'name': '多接口交替使用', 'desc': '在单个任务内动态切换图形界面、命令行、工具调用与代码执行'}{'name': '原生应用驱动', 'desc': '不限于浏览器,可操作原生桌面应用与终端'}{'name': '长任务策略稳定', 'desc': '针对长任务训练动态切换策略,避免在低效界面上反复操作'}{'name': '视觉状态理解', 'desc': '通过屏幕截图理解界面视觉状态并定位可交互元素'}{'name': '低成本任务执行', 'desc': 'OSWorld 2.0测试中官方给出平均单任务API成本1.46美元'}

📋 技术规格

厂商 Yutori
模型分类 多模态理解
参数规模 270亿(27B)
上下文窗口 未公开
最大输出 未公开
知识截止 未公开
API定价 输入: 0.5美元/百万tokens(缓存输入0.05美元/百万tokens)输出: 4美元/百万tokens

⭐ 核心能力详解

270亿参数,专为电脑操作场景设计

覆盖Linux、macOS与Windows三大桌面平台

OSWorld-Verified得分85.3%,MacAgentBench得分83.1%(均为自报)

图形界面、命令行、工具与代码在单任务内交替使用

输入0.5美元、输出4美元每百万tokens,成本定位明确

训练数据由智能体参与生成,形成任务生成与模型训练的循环

🎯 典型应用场景

重复性的仪表盘数据抓取与报表整理

跨应用的办公流程自动化

软件测试中的界面操作与回归验证

运维场景的终端命令执行与排查

内容平台的批量信息录入与更新

需要驱动原生桌面应用的业务流程自动化

💪 技术优势与差异化

  • 交替使用图形界面与命令行,比纯GUI方案更快也更省token
  • 覆盖三大桌面平台,不局限于浏览器场景
  • 单任务成本控制在1.46美元量级,让低价值重复任务具备自动化经济性
  • 27B参数规模在电脑操作类模型中属于轻量档,推理成本优势明显
  • 缓存输入价格为常规输入的十分之一,重复上下文场景成本可控
  • 长任务的接口切换策略经过专项训练,稳定性优于通用模型硬做

⚠️ 使用局限与注意事项

  • 所有公布基准成绩均为Yutori自报,缺少独立第三方验证
  • 发布公告中未宣布开源权重计划,仅通过API提供
  • 上下文窗口与最大输出长度官方未公开
  • 电脑操作类任务的成功率受目标应用界面变化影响,稳定性需持续监控
  • 涉及真实系统操作,权限边界与安全沙箱需使用方自行设计
  • 厂商为新兴公司,长期服务稳定性与生态成熟度需观察

💰 价格分析与成本建议

Navigator n2的定价为输入每百万token 0.5美元、缓存输入0.05美元、输出4美元,官方在OSWorld 2.0测试中给出的平均单任务API成本为1.46美元。这个数字比看起来更有意义,因为它把定价从抽象的token单价换算成了业务可直接理解的单位——每完成一个桌面任务的花费。以此为参照做决策:一个原本需要人工花15分钟完成的重复性操作,如果自动化后单次成本约1.46美元,那么在人力成本高于每小时6美元的场景下就已具备经济性,这意味着大量此前「不值得自动化」的长尾任务进入了可行区间。成本结构上还有两点值得利用:缓存输入价格是常规输入的十分之一,重复执行同类任务时把固定的环境描述与操作规范稳定在提示前部可显著降本;输出价格是输入的8倍,因此控制模型的冗余思考输出比压缩输入更能影响账单。需要提醒的是1.46美元是特定基准下的平均值,实际任务的复杂度分布会让成本上下浮动。

👥 适用人群与企业

业务流程自动化团队、软件测试工程师、运维自动化开发者、需要跨应用数据整合的运营团队、构建智能体产品的技术团队、探索桌面自动化的中小企业

🏭 行业适配度评估

软件与IT★★★★★

跨平台界面回归测试与运维自动化是最直接的落地场景

⚠ 必须在隔离沙箱中运行并建立操作审计

互联网运营★★★★☆

多后台数据抓取与批量信息录入,尤其适合无开放接口的系统

⚠ 目标系统界面变更会导致流程失效,需定期回归

电商零售★★★★☆

多平台商品信息维护与订单处理的重复操作自动化

⚠ 涉及交易操作的环节应保留人工确认关卡

专业服务★★★☆☆

报表整理、资料归集等重复性桌面工作可自动化

⚠ 客户资料处理需评估数据出域风险

金融★★☆☆☆

内部系统的数据核对与报表整理存在自动化空间

⚠ 金融系统操作权限管控极严,且厂商合规信息公开有限,落地门槛高

医疗★★☆☆☆

理论上可用于内部管理系统的重复操作

⚠ 涉及患者数据的系统不宜授予第三方模型操作权限

🔧 技术架构解析

模型定位 270亿参数的电脑操作模型,前代n1与n1.5专注浏览器操作,n2扩展为通用桌面环境操作
接口策略 训练重点是让模型判断何时使用图形界面、命令行、工具或代码,并在长任务中保持策略稳定,避免低效重复操作与无效工具切换
平台覆盖 支持Linux、macOS与Windows三大桌面平台,可操作原生应用、终端与浏览器
训练数据 过去两个月生成超过1万个覆盖数百款应用的任务,智能体参与任务探索、验证器生成与失败案例分析,新问题进入下一轮训练形成闭环
基准成绩 OSWorld 2.0 65.2%、OSWorld-Verified 85.3%、MyPCBench 82.6%、MacAgentBench 83.1%、WeaveBench 70.3%,均为厂商自报
接入方式 通过Yutori API提供,采用兼容主流协议的聊天补全接口;同时驱动Yutori自有的消费级产品

🔒 安全合规与数据隐私

数据训练策略 未公开(Yutori未在发布信息中明确说明API交互数据是否用于模型训练)
合规认证 未公开
数据驻留 未公开(通过Yutori API提供,具体区域部署选项未披露)
加密方式 API调用采用HTTPS/TLS传输加密
电脑操作类模型会真实驱动操作系统与应用,安全风险高于纯文本模型。使用方必须自行设计沙箱隔离、权限最小化与操作审计机制,严禁在未隔离的生产环境中直接授予模型系统级权限。厂商为新兴公司,合规认证信息公开有限,企业采购前需完成尽职调查。

⚔️ Yutori Navigator n2 与同类智能体模型对比

竞品模型 优势 不足
通义千问Qwen3.8-Flash AndroidWorld得分84.5,移动端界面操作能力强 聚焦移动端场景,桌面原生应用覆盖较弱
IBM Granite 4.2 Apache 2.0开源,经智能体强化学习具备终端操作能力 未针对跨平台桌面GUI操作做专项优化
通用前沿大模型 综合能力强,可处理操作之外的推理任务 单任务成本显著更高,缺少接口切换的专项训练
我们的优势:
  • 图形界面与命令行交替使用,找出完成任务的最短路径
  • 覆盖Linux、macOS与Windows三大桌面平台
  • OSWorld 2.0平均单任务成本1.46美元,成本优势明显
  • 27B轻量参数规模带来更低的推理开销
选型建议:Navigator n2适合需要跨应用、跨平台桌面自动化且对单任务成本敏感的场景。若需要开源自建或操作之外的复杂推理,应考虑其他方案。

🏢 同厂商模型矩阵

Yutori Navigator 系列模型定位

模型 定位 品类 特色
Yutori Navigator n2当前 通用电脑操作 multimodal 27B参数,跨三大桌面平台,OSWorld-Verified 85.3%(当前模型)
Yutori目前在本站收录的模型为Navigator n2。该公司此前的n1与n1.5系列专注浏览器操作,n2是首批扩展到完整桌面环境的版本,同时驱动其Delegate、Scouts与Local等消费级产品。后续版本上线后将补充进矩阵。

🧭 选型决策指南

需要自动化操作无开放接口的桌面应用或后台系统强烈推荐

可驱动原生应用与浏览器,覆盖无API的系统

需要跨Windows、macOS、Linux执行同一套流程强烈推荐

三大桌面平台均在支持范围内

重复性任务频次高且单次人工耗时超过15分钟推荐

单任务成本约1.46美元,长尾任务自动化具备经济性

要求基准成绩经第三方独立验证需评估

所有公布成绩均为厂商自报,建议用自有用例复测

需要开源权重做私有化部署不推荐

发布公告中未宣布开源计划,仅通过API提供

操作对象为金融核心系统或含敏感个人数据的系统不推荐

权限风险高且厂商合规信息公开有限

Navigator n2适合跨平台桌面自动化与无接口系统的操作场景。对合规审计要求严格或需要私有化部署的场景,当前阶段应保持谨慎。

🏆 真实使用案例

📌 某运营团队用Navigator n2做多平台数据汇总

应用场景:每日需登录五个不同的后台系统抓取运营数据并整理成统一报表,其中两个系统无开放接口
实际效果:模型对有接口的系统走命令行调用,对无接口的后台走图形界面操作,在单个任务内交替完成
日常数据汇总人工耗时由约80分钟降至无人值守,单次执行成本控制在数美元量级

📌 某软件团队用于跨平台界面回归验证

应用场景:产品需在Windows与macOS上验证核心流程,人工回归测试占用大量测试人力
实际效果:模型在两个平台的桌面环境中执行相同的操作路径,记录界面状态差异并输出异常报告
回归验证覆盖周期由每周一次提升至每日一次,人工测试工时减少约五成

💬 用户真实评价

自动化工程师
⭐⭐⭐⭐

能在一个任务里既点界面又敲命令,这个设计比纯GUI的方案实用太多,很多步骤直接一条命令就过去了。

测试负责人
⭐⭐⭐⭐

跨Windows和macOS做同一套流程验证省了不少事。不过基准分数都是厂商自己跑的,我们还是按自己的用例重新评估了一遍。

IT运维经理
⭐⭐⭐⭐

单任务一美元多的成本让很多以前懒得自动化的杂活变得值得做了。但模型是真的在操作系统,沙箱和权限这块必须自己搭好。

✅ 实践建议与使用技巧

1. 优先自动化高频重复任务:单任务成本约1.46美元,先挑选人工耗时长、执行频次高的流程测算投资回报。
2. 稳定环境描述以命中缓存:把系统环境、应用版本、操作规范等固定内容放在提示前部,缓存输入价格仅为常规的十分之一。
3. 在受控沙箱中执行:模型会真实操作系统与应用,必须设计明确的权限边界与隔离环境,避免误操作影响生产数据。
4. 引导优先使用命令行:对可以用命令完成的任务显式提示优先走终端,比图形界面点击更快也更省token。
5. 持续监控界面变化:目标应用界面更新可能导致既有流程失效,应建立定期回归验证机制。

💡 Prompt工程建议

显式提示优先使用命令行

对可以用命令完成的操作明确引导走终端,比图形界面点击更快且token消耗更少。

示例:「如果目标文件可以用命令行批量重命名,请优先使用终端而非文件管理器逐个操作。」

固定环境描述放在提示前部

系统版本、已装应用、操作规范等不变内容前置且保持稳定,才能命中缓存降低成本。

示例:把「运行环境:macOS 15,已安装Chrome与Excel;禁止操作桌面以外的目录」固定在提示开头。

为长流程设置检查点

把长任务拆成若干阶段,每阶段结束要求模型汇报当前状态,便于失败时定位与续跑。

示例:「每完成一个后台系统的数据抓取,先输出已获取的数据摘要再继续下一个。」

明确禁止操作的边界

模型会真实操作系统,在提示中显式列出禁止触碰的目录、应用与操作类型。

示例:「不得删除任何文件,不得修改系统设置,不得访问指定目录之外的路径。」

🔄 替代方案分析

需要开源可自建的智能体方案
IBM Granite 4.2通义千问Qwen3.8-Flash

开源权重支持本地部署,其中Granite 4.2的8B与30B经过智能体强化学习具备工具调用与终端操作能力。

自动化对象以移动端应用为主
通义千问Qwen3.8-Flash

AndroidWorld得分84.5,在移动端界面操作场景更专精。

需要操作之外的复杂推理与规划
腾讯混元Hy4 preview智谱AIGLM-5.3-Flash

这些模型在长程规划与复杂推理上能力更强,可作为编排层与操作模型配合。

仅需浏览器内的网页自动化
通义千问Qwen3.8-Flash智谱AIGLM-5.3-Flash

多模态模型配合浏览器自动化框架即可覆盖纯网页场景,成本更低。

❓ 常见问题解答

Q: Yutori Navigator n2的参数规模是多少?
A: Navigator n2是270亿(27B)参数的电脑操作模型,于2026年8月26日发布。
Q: Navigator n2与前代n1、n1.5有什么区别?
A: n1与n1.5专注浏览器操作,主要驱动网站;n2是通用的电脑操作模型,可驱动完整桌面环境,包括原生应用、终端与浏览器。
Q: Navigator n2支持哪些操作系统?
A: 支持Linux、macOS与Windows三大桌面平台,其中MacAgentBench专门覆盖跨25款应用的真实macOS任务。
Q: Navigator n2的定价是多少?
A: 输入每百万token 0.5美元、缓存输入0.05美元、输出4美元。在OSWorld 2.0测试中,官方给出的平均单任务API成本为1.46美元。
Q: Navigator n2的基准成绩如何?
A: 官方公布OSWorld 2.0得分65.2%、OSWorld-Verified 85.3%、MyPCBench 82.6%、MacAgentBench 83.1%、WeaveBench 70.3%。这些均为Yutori自报成绩。
Q: Navigator n2开源吗?
A: 不开源。发布公告中未宣布开源权重或开源许可计划,模型通过Yutori API以及该公司的产品提供。