立即咨询

电话咨询

微信咨询

立即试用
商务合作

装100个技能不如装5个:我实测后搞懂了Skill的正确用法

2026-09-03

 

 

 

先说结论:别急着往AI里装一堆Skill,装多了反而更笨。这句话不是我拍脑袋说的,后面有一组很扎眼的实测数据。

 

从一个翻车场景说起

 

我之前一直有个困惑:明明模型能力不差,为什么每次开新对话,它都像失忆了一样,从零开始猜我要什么格式、什么口径。

 

打个比方,一个什么菜系都会的大厨,就是做不出你外婆那道红烧肉。差的就是那份独家秘方。

 

这份秘方,现在有个正式的名字:Skill。

 

 

这个思路其实不新

 

2023年就有一批研究者干过一件事:让AI在《我的世界》里玩,把它学会的本事存进一个技能库,下次遇到类似的活直接调用,不用从头学一遍[1]。

 

 

 

 

只是当时的技能还是一段段代码,只活在论文里。直到两年后,Anthropic在2025年10月把Skill变成普通人不用写代码也能用的格式[2],现在这个格式已经开放成标准,40多家主流厂商都在沿用[3]。

 

Skill到底是什么

 

说白了就是一份提前写好的工作指南:某类任务按什么步骤做、输出什么格式、注意哪些坑,一次写清楚,以后AI自己识别、自己应用。

 

技术上,一个Skill就是一个文件夹,核心是一份叫SKILL.md的文件,里面全是自然语言。不用写代码,相当于把你脑子里的工作流程翻译成AI看得懂的菜谱。

 

 

你可能会问,这跟提示词有什么区别?

 

区别在调用方式。这就要说到Skill设计里我认为最妙的一点:渐进式披露。

 

为什么不把指令一次全塞给AI

 

直觉上,把所有要求一次性给AI更省事。但实际正好相反:塞太多,AI会变笨。

 

有研究团队测过18个主流大模型,结论很一致:输入越长,模型越容易抓不住重点、被无关信息带偏、漏掉关键细节[4]。

 

 

 

现在的模型都号称支持超长上下文,但装得下和用得好是两码事。上下文窗口是公共资源[6],你塞进去的越多,分给每条信息的注意力就越少。像一间会议室,谁都多占一点,占满了就开不了会。

 

所以Skill被设计成文件夹的样子:主文件只放主流程,模板、案例、规范这些细节拆到附带资料里。AI接到任务先扫一眼各技能的简介,判断哪个用得上,真用上了才去翻对应的文件。

 

 

用到哪章,才拿哪章。这就是渐进式披露。

 

滥用的代价

 

讲完原理讲坑。装Skill是有成本的:一是占技能菜单位置,装多了菜单变杂物间;二是干扰意图判断,AI干活前得先从一堆技能里挑出该用的那个,技能越多越容易挑花眼。

 

有研究者实测过:可用技能从5个涨到100个,AI挑中正确技能的准确率从29.6%跌到3.3%[5]。

 

 

 

翻译一下:装一百个,大概率不如只装五个。

 

(注意图中数字是挑中正确技能的准确率,不是任务成功率[5])

 

那什么任务值得做成技能?我的判断标准是三条:

 

重复做的,比如周报、数据整理、会议纪要; 有固定格式或标准的,比如公文模板、审核标准、文案口径; 想沉淀成个人经验的,比如你的判断逻辑和流程方法。

 

跟AI解释过三遍的事,才值得做成技能。一次性的需求,让它过去。

 

实操:怎么创建、怎么获取

 

创建最省事的办法是让千问办公自己写。直接在对话里说“帮我做一个能做某件事的技能”,它会一步步带你完成。

 

更懒的办法:先让它把一件事做好,效果满意了,说一句“把刚才的流程沉淀成技能”,它会自动总结归档。当然也可以自己写文件上传。

 

 

不管谁来写,一个合格的技能要讲清三件事:什么时候用、步骤怎么走、输出长什么样。写得越清楚,发挥越稳定。

 

获取现成的也简单。技能广场里官方加社区的技能有好几千个,看到合适的一键安装。你甚至不用自己逛,直接说“帮我找一个能做某件事的技能”,它替你搜索、替你装。

 

想把技能写得更好,三条经验:

 

触发描述是命门,要说清“做什么”加“什么时候用”,写得含糊它可能永远不会被调用; 正文控制在500行以内,细节资料拆出去单放; 引用资料只放一层别套娃,AI翻目录也会迷路。

 

进阶玩法:专家套件

 

单个Skill是把趁手的工具,专家套件就是整个岗位的工具箱。它把多个技能、数据连接、快捷命令和输出标准打包成一套岗位方案,比如法务套件内置合同审查、法律文书等一系列技能。

 

安装入口在扩展→专家套件,点加号即可;装好后在对话框输入/就能看到全部命令。

 

我觉得对企业最有价值的用法是:让最懂业务的人把岗位流程和判断标准做成套件,全员一键安装。新人的起点,就是老手的标准。

 

参考

 

[1] Voyager: An Open-Ended Embodied Agent with Large Language Models,NVIDIA(联合 Caltech / Stanford / UT Austin),NeurIPS 2023,arXiv 2305.16291

 

[2] Anthropic 工程博客:Equipping agents for the real world with Agent Skills(2025-10-16)

 

[3] Agent Skills 开放规范:agentskills.io/specification(2025-12-18 发布为跨厂商开放标准)

 

[4] Chroma 研究报告:Context Rot(2025-07-14)

 

[5] Demystifying Agent Skills,arXiv 2608.14036(2026-08)

 

如果你正在为团队评估企业级 AI Agent 的选型与落地,可以直接找云巴巴聊聊。云巴巴是腾讯云 AI 智能体示范伙伴、腾讯 WorkBuddy 核心伙伴及官方授权服务中心,汇聚了 WorkBuddy、千问办公、TRAE Work 等多家主流 Agent 工具与方案,能结合你的数据边界、任务形态和团队能力,从选型对比、方案验证到陪跑落地提供一站式服务。欢迎咨询云巴巴,获取专属的 Agent 实施落地方案。

热门数字化产品

i人事HR SaaS软件i人事HR SaaS软件,实时监控组织发展关心的关键指标,组织整体战斗力、效能与效率,关键岗位的引入、留用与激励。人力预算支出过程管控与预测参考,成本中心与财务科目的灵活匹配,投入产出比核算效率提升。雇主品牌、快速上岗,移动办公,高效协同,员工体验、持续绩效提升。
法大大电子合同SaaS平台法大大电子合同法律效力等同于纸质合同,保障用户权益。人脸生物科技识别、银行卡要素等多重技术手段实名认证,确保颁发电子签名为本人专有。向企业和个人提供全流程的电子合同服务,完善的产品与服务体系。
壹悟科技智能物流仿真系统Simulator壹悟科技智能物流仿真系统(Simulator)可以实现对仓储场景和工厂场景的业务流程仿真。支持用户导入项目现场运行地图,自定义移动机器人的参数和数量,以真实的物流业务调度系统(WCS)和机器人调度系统(RCS)为内核,驱动仿真运行,高度还原业务实际场景的作业流程和节拍。支持2D和3D实时运行显示,并提供完善的运行数据统计分析。
易仓ERP易仓ERP是3万+跨境卖家的增量选择,多平台多订单处理,多海外仓比价,易仓ERP系统6小时数据更新,财务核算又快又准,能够提高运营决策的准确度。
OpenAI CodexOpenAI Codex(Codex CLI)是 OpenAI 推出的开源终端 AI 编程代理,使用 Rust 构建以保证高性能与高效率。它可直接在本地终端运行,读取、修改并运行所选目录中的代码,与 ChatGPT 深度集成,面向终端驱动的 agentic 编码工作流。
为你推荐
跨境独立站访问慢怎么办?网宿科技全站加速WAS的海外提速实践

围绕跨境独立站访问慢的痛点,解析网宿科技全站加速WAS在海外节点布局、动静分离加速与智能调度上的能力,给出上线验证与运维建议。

2026-09-08
电商反爬方案怎么选?网宿BotGuard爬虫管理的识别与治理机制

围绕电商反爬与数据防抓取场景,拆解网宿BotGuard爬虫管理的识别机制与执行策略,给出评估维度、落地节奏与选型对比建议。

2026-09-08
突发DDoS攻击怎么应急?从识别牵引到复盘加固全流程

突发DDoS攻击如何应急?本文梳理攻击识别、流量牵引切换、业务降级保护、事后复盘与常态加固的完整处置流程,结合网宿DDoS云清洗的云端清洗机制,帮助企业把攻击造成的服务中断风险降到更低水平。

2026-09-08
网站动静分离加速怎么办?网宿科技全站加速WAS的统一调度实践

围绕网站动静分离这一加速基本功,解析网宿科技全站加速WAS在静态缓存、动态链路优化与统一调度上的能力,给出验证与持续调优建议。

2026-09-08
金融业务安全监测怎么做?网宿网站安全监测的告警与处置实践

面向金融业务场景,解析网宿网站安全监测在漏洞、内容、可用性三条线的监测能力,给出落地步骤、防护协同与合规选型建议。

2026-09-08
查看更多