Agent Skills 体系:可复用能力的标准化与生态重塑
2026-08-26 Agent Skills 体系:可复用能力的标准化与生态重塑
📅 学习日期:2026-08-26 | 📚 来源:AI Agent 知识库 | 📝 综合文章数:5 篇
为什么选这个主题
昨天学 Agent 自我进化时,Hermes Agent 能自动生成 Skill、AgentLoop 把经验沉淀为 Skill——但 Skill 本身 是什么、为什么 2025-2026 突然爆发出 10 万+ 公开技能、OpenAI / Anthropic 如何把它做成”AI 时代的 Dockerfile”?今天把 Skills 作为独立主题系统拆解,补齐 8-25 自我进化”产物层”的细节。
核心要点
要点 1:Skills = 模块化能力包,“渐进式披露”是其工程化灵魂
Agent Skills 是 Anthropic 提出的开放标准,核心结构是一个含 SKILL.md 的文件夹,可选携带 scripts/(Python/Bash 脚本)、references/(按需文档)、assets/(模板/图标/字体)三类资源。它把”指令 + 元数据 + 可选资源”封装成可安装、可分发、可版本化(Git 管理)的能力单元,本质是 把程序员世界的”封装、复用、模块化、懒加载”思维套到 AI 能力管理上。
渐进式披露(Progressive Disclosure) 是它最核心的工程设计,分三级:
| 层级 | 加载内容 | 时机 | 体积 |
|---|---|---|---|
| Level 1 | YAML 元数据(name + description) | 始终加载 | ~100 tokens |
| Level 2 | SKILL.md 正文(工作流、最佳实践) | 描述匹配用户请求时 | 建议 ≤ 5000 tokens |
| Level 3 | references/ / assets/ / scripts/ | 执行时按需访问 | 无上限(脚本输出才入上下文) |
关键工程含义:与普通 Prompt 每次都”全量灌入上下文”不同,Skills 走 懒加载路径——AI 启动时只看到技能名+功能描述(一行),判定相关后才读取正文,复杂场景才拉取子文档和脚本。这让”几十个 Skills 并存”成为可能,彻底解决”提示词越写越长”的上下文浪费痛点。
要点 2:Skill ≠ MCP ≠ Prompt,三位一体协同
这是入门者最容易混淆的概念。三者层级不同:
| 维度 | Prompt | MCP | Skill |
|---|---|---|---|
| 定位 | 一次性任务指令 | 工具调用的通信协议 | 任务执行的标准能力包 |
| 粒度 | 单次对话上下文 | 接口级(类似 OpenAPI for AI) | 应用级(类似 Docker 镜像) |
| 作用 | 告诉模型”做什么” | 告诉模型”工具怎么调” | 封装”完整任务流程” |
| 复用性 | 低(需复制粘贴) | 中(接口可多 Prompt 复用) | 高(跨会话/跨应用直接加载) |
| 心智类比 | 一句话任务 | USB-C 接口协议 | 装好的 App |
协同工作流:Prompt 告诉模型”当前任务是什么” → 模型匹配到合适的 Skill → Skill 内部逻辑通过 MCP 调用所需工具(数据库、API、CLI) → 完成任务。
Skill 是 Prompt 的容器(每个 Skill 内部必含精心设计的 Prompt),同时是 MCP 的消费者(脚本通过 MCP 连接真实世界)。三者缺一不可。
这与 8-6 MCP 协议标准化、8-25 自我进化里”Skill 自动生成”形成完整闭环:MCP 是”能力接入协议”,Skill 是”能力封装容器”,自我进化是”Skill 持续生成器”。
要点 3:OpenAI 38 个精选技能覆盖 11 大领域,跨平台共享同一标准
OpenAI 基于 Anthropic 提出的开放标准维护了 openai/skills 仓库,分为三层:
openai/skills/├── .system/ ← 5 个系统内置技能(启动即用)├── .curated/ ← 38 个官方精选技能(需手动安装)└── .experimental/ ← 社区实验性技能5 个系统内置技能是基础设施层:skill-installer(装技能)、skill-creator(6 步创建技能)、plugin-creator(打包 Plugin)、openai-docs(查询官方文档)、imagegen(图像生成)——后两个是其他技能的依赖项。
38 个精选技能分 11 个领域(部分列举):
| 领域 | 数量 | 代表技能 |
|---|---|---|
| Figma 设计工作流 | 8 | figma-implement-design(设计 1<1>1> 实现为代码)、figma-generate-library(代码库构建设计系统) |
| 项目管理 & 协作 | 6 | linear、sentry、notion-spec-to-implementation |
| 内容处理 & 媒体 | 5 | pdf、transcribe、speech、screenshot、jupyter-notebook |
| 云部署 | 4 | vercel-deploy、netlify-deploy、cloudflare-deploy、render-deploy |
| GitHub 工作流 | 3 | gh-address-comments、gh-fix-ci、yeet(一键提 PR) |
| 安全 | 3 | security-best-practices、security-threat-model、security-ownership-map |
| 框架平台 | 3 | aspnet-core、winui-app、chatgpt-apps |
| 测试 & 浏览器 | 2 | playwright、playwright-interactive |
| OpenAI 生态 | 2 | openai-docs、migrate-to-codex(迁移 Claude Code 配置) |
| CLI 工具 | 1 | cli-creator(为任意 API 生成可复用 CLI) |
| 趣味 | 1 | hatch-pet(生成 Codex 动画宠物) |
关键洞察:由于 Agent Skills 是 跨平台开放标准,Claude Code、Codex CLI、Cursor、GitHub Copilot、OpenCode 共享同一格式——一个技能可打包后在 5 个平台运行。OpenAI 还专门提供 migrate-to-codex 技能帮 Claude Code 用户无缝迁移,这是 “Write once, use everywhere” 的工程化兑现。
要点 4:生态规模爆炸——10 万+ 公开技能,Linux 基金会候选标准
截至 2026 年 2 月初,公开可查的 Agent Skills 超过 85,000 个;到 2026 年中已突破 10 万+,且保持每周数千新增(skills.sh 平台每小时新增 550+)。支持该标准的主流平台达 27 家,覆盖开发、设计、办公、电商、金融等领域。
头部效应已显现:
- 头部 Skill
find-skills(发现其他技能)安装量超 19.41 万+,成为事实上的”技能搜索引擎” - 阿里云开源的金融行业 Agent 百技图,已落地 100+ 金融数字员工 Skill
- Linux 基金会启动讨论,拟将 Agent Skills 纳入其 AI & Data 基金会(AIDF)候选标准
行业类比:
- TechCrunch 称之为 “AI 领域的 Dockerfile”——把 AI 能力像 Docker 镜像一样容器化
- 业界定位为 AI 时代的 “npm” 或 “App Store”——每个 Skill 就是一个微型应用
- 范式转变:从”AI 百科全书式的顾问”进化为”开箱即用的执行者”
要点 5:2026 升级版技能创建器,端到端 TDD 闭环
传统 Skill 开发的最大痛点:感觉好 ≠ 真的好——你改了 SKILL.md,不知道是改好了还是改坏了。2026 升级版 Claude 技能创建器内置 4 种模式 实现端到端闭环:
| 模式 | 功能 | 关键输出 |
|---|---|---|
| Create | 创建技能初稿 | SKILL.md 草稿 + 文件夹结构 |
| Eval | 逐提示通过/失败评估 | grading.json、metrics.json |
| Improve | 针对性差异优化 | 更新后的 SKILL.md / 脚本 |
| Benchmark | 时间/token/通过率 + 波动 | 统计置信度报告 |
四类成功标准(必须在创建前定义清楚):
| 类别 | 核心问题 | 典型检查 |
|---|---|---|
| 结果目标 | 任务完成了吗? | 最终产物存在、字段正确 |
| 流程目标 | 技能触发了吗?步骤遵守了吗? | 步骤顺序、关键节点 |
| 风格目标 | 符合规范吗? | 格式、措辞、品牌一致性 |
| 效率目标 | 无重复执行/无浪费? | Token 消耗、文件冗余 |
TDD 循环实战:
检查失败 → 修复 SKILL.md/脚本 → 重新运行 → 对比结果 ↑ ↓ └────────── 记录到评估集 ←────────────────┘退化检测维度(关键!技能上线后最大的隐患):
- 不触发:描述失效,技能未被加载
- 跳步:关键步骤被跳过
- 产生冗余文件:输出契约失效
- 静默行为改变:用户感知不到,悄悄变差
防止退化的工程纪律:
- 描述含 WHAT + WHEN + 真实触发短语
- 每次手动修复 → 新增一条评估用例(CSV/evals.json 是”活文档”)
- 发布前至少跑一轮
eval → improve循环 - 测试套件与生产代码分离(
.skill打包时排除evals/)
分歧与讨论
- “Skill 会不会取代 Agent 框架?”
- 一派认为 Skill 是”轻量调度器 + 可插拔能力模块”,未来 80% 场景不需要新 Agent,只需 Skills 组合
- 另一派认为复杂业务仍需 Agent 框架(LangGraph、AutoGen)做编排,Skill 只是能力层
- 折中观点:Skill 是 能力原子化 的终局,Agent 框架会演化为”Skill 编排引擎”
- “提示词工程师会被 Skill 工程师取代吗?”
- Skill 工程的工程化要求(YAML、版本管理、评估 CI)实际上提高了门槛
- 但其可复用性让”一次性提示词”的低价值工作被消灭
- 警示:流程化岗位(如基础文档处理、模板化回复)面临被替代风险
- “Skill 数量爆炸后会陷入’选择困难’吗?”
- 当前主流实践建议”技能控制在 20-50 个”,超过会触发描述冲突
- 但生态要求”越多越好”——
find-skills类元技能(搜索引擎)成为刚需 - 未来可能演化出”动态 Skill 加载池”(按用户/任务上下文动态推荐 Top-N)
与已学内容的联系
- 8-25 Agent 自我进化:Hermes Agent 的”技能催促计数器 + 三维后台审查 Agent”是 Skill 自动生成器——它是 Skills 生态的关键供给侧。今天学的 SKILL.md 结构、TDD 评估循环就是 Hermes 内部用到的工程方法
- 8-14 Agent 协议标准化 / 8-6 MCP:MCP 解决”工具怎么调”,Skill 解决”任务流程怎么固化”。两者构成 能力接入层 + 能力封装层 的完整协议栈
- 8-17/8-18 Harness 工程:Harness 是 Agent 的”运行时脚手架”,Skill 是 Agent 的”能力积木”——一个管过程,一个管功能
- 8-3 Tool Use:Tool 是原子能力(一次调用),Skill 是 Tool 的”流程编织”——Skill 内部可调用多个 Tool 完成复杂任务
- 8-21 Agent 成本控制:Skills 显著减少 Token 消耗(按需加载),是 结构性的成本优化(不仅是”用更便宜的模型”)
💡 思考题
- 思辨题:如果 Skills 真是”AI 时代的 Dockerfile”,那么 Skill 镜像仓库的安全性、供应链攻击(恶意 Skill)会演化成什么样?Anthropic / OpenAI 当前只做”官方精选”和”社区实验”两层隔离,但 10 万+ 规模后是否需要”包签名 + 漏洞扫描 + 沙箱执行”的全套机制?
- 应用题:假设你所在团队要做一个”财务对账”垂直 Agent,过去做法是写一个专属 Agent(自定义 prompt + 多个 tool + 流程编排)。现在请你用 Skill 范式重做:你会怎么拆 SKILL.md?怎么定义四类成功标准?评估集至少包含哪几类用例(显式/隐式/上下文/负向)?
🎯 行动项
- 动手做:在 Claude Code 或 Codex CLI 中安装 1-2 个精选技能(如
gh-address-comments+notion-knowledge-capture),跑一遍完整任务,体验”渐进式披露”的真实效果——观察 Token 消耗对比(纯 Prompt vs Skill 加载) - 写一个自己的 Skill:用官方
skill-creator元技能引导自己创建一个”周报生成 Skill”。要求:(a) 定义四类成功标准 (b) 写 10 条评估用例(含 2 条负向)(c) 跑完Create → Eval → Improve → Benchmark全流程,提交到 Git 仓库作为个人数字资产 - 延伸探索:搜索
Mem0/Letta长期记忆库与 Skills 的结合点——Skills 是”任务执行单元”,Memory 是”任务间知识沉淀”,两者结合才能实现”昨天的 Skill 经验成为今天 Skill 的输入”。这是 8-25 自我进化在 Skills 层的具体落地
参考文章
- 《AI 圈狂吹的 Agent Skills,5分钟学会!》 — 入门科普:Skills 是什么、三级加载机制、与普通 Prompt 的区别
- 《Agent Skill 机制详解:原理与使用方式》 — 运行原理:三级加载细节、Skill vs MCP、显式/隐式模式、Skill-Creator 实战
- 《OpenAI 官方 Agent Skills 完全指南》 — 官方标准:openai/skills 仓库结构、38 个精选技能 11 大领域全景、跨平台安装路径
- 《Agent Skills:打通可复用专业领域知识的最后一公里》 — 价值与生态:10 万+ 技能、Linux 基金会候选标准、与 Prompt/MCP 的协同关系
- 《Agent Skills:完整工作流(构建→测试→基准测试→迭代优化)》 — 工程实践:2026 升级版技能创建器 4 模式、TDD 循环、防退化的 5 项纪律
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!













