
都说Agent Skills没用了?11个主流编码Agent的源码里,9个都实现了它
争论有没有用时,投票早已结束——11个系统里9个实现了技能包,票箱公开,源码可查;真正会没用的,是写成流程脚本的那种skill。
目录
前几天刷到一条技术帖,标题很斩钉截铁:"Agent Skills 已经没用了。"点进去,论证大致是:模型越来越强,谁还需要给 AI 写手册?那东西不就是提示词换了个文件夹吗。评论区一片附和,最高赞写着:"早说了,就是提示词换了个文件夹。"
我倒不急着反驳——这坑樊军刚AI 自己也踩过,写过写完就废的 skill(技能包,给 AI 写的、一读就会干的手册),后面细讲。但"没用了"这个结论,和我手上另一份材料对不上:2026 年 9 月,预印本论文库 arXiv 上出现一篇论文,把 11 个生产级编码 Agent(能自己干活的 AI 编程系统)的源码逐个拆开研究了一遍。
先把答案放桌上:说 skills 没用的,多数是把 skill 写成了工作流脚本;失败的是写法,不是机制。 证据很硬:据 2026 年 9 月发表于 arXiv 的论文《Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents》(编号 2609.00006,对 11 个生产级编码 Agent 的源码研究),截至该论文 2026 年 9 月版本,11 个系统里有 9 个实现了 SKILL.md(技能包的说明书文件)格式的技能包。标题里那个 harness(行业术语,直译是马具、缰绳——第09篇把它译作缰绳),后面有一节专门讲。
一场没人注意的投票:9 比 8
论文研究的 11 个"选民"是:Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw——含 Anthropic、OpenAI、Google 的官方编码 Agent 在内。
据该论文(以下数据均截至其 2026 年 9 月版本):9 个系统实现了 SKILL.md 格式的技能包,只有 Aider 和 Mini-SWE-Agent 没做;实现 MCP(模型上下文协议,管 AI 怎么接工具和数据源)的是 8 个。趋势更有意思:2026 年 4 月版里,两者在 8 个系统中还是 6 比 6 持平;7 月扩大样本后,skills 开始领先。
再看票投完之后,这个"没用了"的东西长出了什么:
- 包管理器经济:远程技能注册表(类似集中下载仓库)已出现在 4 个系统——Mistral Vibe、OpenCode、Hermes Skills Hub、OpenHands marketplace;Hermes 做信任分级、安装前静态扫描、隔离与依赖检查,OpenClaw 走来源验证审批,Gemini CLI 加固安装路径穿越,Codex 自动安装技能声明的 MCP 依赖
- 自己生长的机制:Hermes 的后台复审代理会从已完成任务里生成和修补技能(有策展者维护集合);Gemini CLI 的抽取子代理把会话挖成技能补丁,送给人审
- 加载经济学:9 个采用者里 8 个只预载技能元数据(名称加一句描述)、正文按需读取——省着用最贵的资源,是认真在做,不是敷衍
时间线同向:据 Anthropic 官方公告及公开报道,Agent Skills 2025 年 10 月 16 日发布,2025 年 12 月 18 日开放为行业标准,48 小时内微软与 OpenAI 宣布支持,至 2026 年 3 月已有 32+ 工具兼容同一份技能文件。"没用了"的东西,不会在半年内长出包管理器经济。
边界必须划清:这是采用面数据,不是"取代"数据——论文口径是两者处于不同层、可以组合;个别系统如 Pi 实现了 skills 但明确不做 MCP,个别立场不是行业结论。
11 张选票,9 张投给 skills、8 张投给 MCP。争论"没用了"的时候,造这些系统的人已用代码投了票——这场投票没人开发布会,但票箱公开:源码就在那儿。
Skill 的本质:给通才的入职手册,不是给机器的程序
据 agentskills.io 官方规范,一个技能就是一个装着 SKILL.md 的文件夹:YAML 头部(文件开头几行配置)必填 name(≤64 字符)和 description(≤1024 字符),可带 scripts/、references/、assets/ 三个目录。
想象一个能力很强、但每天早上醒来就失忆的通才——skill 就是你递给他的入职材料,成立靠三个机制,缺一不可。
第一,渐进披露。元数据(名称加描述)约 100 token(AI 的文本计量单位),启动时全量注入;正文建议 5000 token 以内、不超过 500 行,任务匹配才读;深细节放 references/ 按需再读。据 Microsoft Learn 的 Agent Skills 文档,微软同样把加载拆成四步:广告、加载正文、按需读资源、按需跑脚本。本质是一件事:上下文预算管理。注意,description 不是简介,是路由键——它决定模型何时想起这份手册。
第二,模型驱动的路由与组合。何时用、用哪几个、什么顺序,由模型在运行时决定——这正是它和工作流相反的地方。
第三,知识与代码分工。判断留给模型,确定性的动作下沉为脚本。
第二条是所有争论的根。据 Anthropic 2024 年 12 月工程博客《Building effective agents》:工作流是 LLM(大语言模型)与工具按预先写死的代码路径编排,智能体是 LLM 自主决定过程与工具使用;同一篇文章还主张,确定性场景优先用工作流。第09篇聊过这条分界线(工作流是自动贩卖机,Agent 是员工),原话只有一句:下一步干什么,是人提前写死的,还是AI当场自己决定的。 skill 站在"当场决定"这一边:给模型弹药,不替模型扣扳机。
为什么有的 skill 会"没用":三个下场,三个症状
现在可以正面回答那条帖子了。喊"skills 没用"的人,手里的 skill 大概率长这样:步骤 1 到 12 的流水账;满篇"必须"与"禁止";用自然语言写伪代码。这不是手册,是抻长了的流程脚本。这种写法,有三个注定的下场:
- 脆:真实任务永远有脚本没想到的变体,一偏航就"AI 不听话"
- 贵:步骤越写越长,吃光上下文,模型的注意力被稀释
- 不泛化:模型本来能处理的变化,被脚本提前禁掉了
失败的是写法,不是机制。这个坑我自己踩过——第一版 skill 就写成了流程,程序员的本能,不是罪过;出路是改写法:流程挪进 scripts/,正文改写成判断依据。
出口句先立住:该写死的地方写死是纪律,不该写死的地方写死是偷懒(第57篇原句)。权限、留痕、格式校验本来就该写死——但写死的位置是 scripts/ 里的脚本,不是正文里的叮嘱。工作流也不是敌人:确定性部分下沉为脚本,正是它的位置;写过一堆流程文档的团队,东西不用作废。
一句话记住就行:手册写的是标准和坑,不是步骤;步骤交给脚本。
模型越强,手册越值钱,不是越不值钱
那条帖子真正的误判,是把两类知识混成了一类:模型会"怎么做"——通用能力,随升级增强;模型不会"在你这儿怎么算做对"——你的领域上下文、组织规矩、坑、工具入口,不随升级改变。第59篇把手册这件事讲透过(技能包是给 AI 写的手册),接着说一句:手册里"怎么做"那部分随模型贬值,"什么算对、哪里有坑"那部分不贬值。
新手需要菜谱,专家只需要被告知关键约束和坑——AI 正在从新手长成专家,手册从菜谱进化成简报,需求只增不减。资产账也算得过来:模型是 CPU,harness 是操作系统,MCP 是驱动,skills 是库;换 CPU 不用重写库,手册是可移植的资产层。把手册写成流程的批评者,是用批处理脚本的思路写应用。而 AI 已开始自己写手册:每次出错改一行,永不再犯——组织记忆的复利。
Skills 只是七个子系统之一:harness 工程登场
开头卖的关子,现在揭开:harness 是模型之外、把模型接到世界上的一切——循环、工具、上下文、安全控制、编排、扩展面;Harness 工程,就是设计和演进这个运行时的学科。论文的核心等式:Agent = Model + Harness。
据这篇论文的 2026 年 9 月版本:等式由 LangChain 工程系列在 2026 年初推广,"harness engineering"一词 2026 年 2 月进入流通(Mitchell Hashimoto 顺带提及,LangChain 的 Trivedy 定义阐述),这门学科"在 2026 年初被命名"。论文还把 11 个系统拆成七个子系统:Agent 循环、模型接入、工具与动作、记忆与上下文、安全与权限、编排(子代理)、可扩展性(配置、hooks(挂载点)、skills、插件、MCP),另有界面层与会话底座两个横切面。skills 住在"可扩展性"那一格,七个子系统之一;第09篇讲过的缰绳四件套(权限、审批、留痕、兜底),住在"安全与权限"那一格。
这门学科最反直觉的发现,是地板极低:Mini-SWE-Agent 用约 100 行代码实现了全部七个子系统——一个 while 循环、一个模板、一个工具、一条消息列表、两个上限、无编排——在 SWE-bench Verified(业界常用的编码能力基准测试)上的成绩,与比它大三个量级的系统处于同一区间(论文自注:自报数据、模型与日期不同)。但论文同时指出,区分地板与生产系统的,不是"能否完成任务",而是安全、恢复、成本管理、可扩展性与平台化界面。
实践侧的对照也有了。据 OpenAI Codex 团队 2026 年公开分享(本文依据公开转述):约 5 个月、约 100 万行代码、零行人工手写、约 1500 个 PR(合并请求,代码入库前的评审单),产品有内部日活用户和外部 alpha 测试者;人只做三件事——设计环境、说明意图、建反馈回路。架构约束写成自定义 linter(代码风格检查器)与结构测试,不写成提示词里的告诫;报错信息写成 Agent 能据此自修的说明;文档即知识库,AGENTS.md(仓库根目录给 AI 看的总说明)当目录;Agent 对 Agent 评审,人工评审变成可选。
另据公开转述的 OpenAI 2026 年 8 月平台发布说明:保留推理、上下文压缩等 harness 层优化,把某模型在 ARC-AGI-3(测通用推理的基准)上的分数从 13.3% 提到 38.3%,token 消耗降到约六分之一——同一个模型,换套环境,分数接近三倍。
这门学科的第一条思想,也是本篇最想留下的一句:模型是给定的,杠杆全在环境。 权重你改不了,环境全是你的:不在环境里的知识,对 AI 等于不存在;机械约束优先于口头告诫——一个报错附修法说明的检查器,胜过提示词里一百条"禁止";没有闭环的 AI 不是员工,是生成器。
怎么写一个不会"没用"的 skill:六条清单
最后一个问题,最实际的一个。六条,当检查单用:
- description 当路由键写:写清"什么任务该用它",不是写简介
- 正文写专家简报,不写流水账:目标、可检查的标准、坑、判断点、工具入口、自检方法
- 确定性动作下沉脚本:能用代码检查的,不写成自然语言要求;脚本放 scripts/
- 用正向约束加可检查标准,替代大段"禁止":告诉它对的样子长什么样,比一百条"不许"管用
- 主文件短,深细节放 references/:5000 token 以内是预算纪律
- 每次失败改 skill,不加提示词补丁:补丁随对话消失,手册留下来
写的时候拿框架自查:给AI派活,说三样、备两样:说目标、标准、边界,备知识、工具。 skill 就是"备知识"的那一格。再检查标准与边界有没有放错:边界事前拦,标准事后验。"不能动生产数据"要写进权限拦住,不是写进正文祈祷;"输出要专业"要变成可检查的验收项,不是捆住手脚的禁令。
这套清单不只对程序员成立:老板给供应商、给员工写的需求文档,同理。
我自己就活在这套机制里
樊军刚AI 的日常交付,就运行在自研的AI军团Harness协作体系里:军长规划调度、士兵并行施工、条令铁律、反幻觉防线(不采信"已完成"的自报、必须附测试原始输出、施工与质检不是同一个脑子、失败升级)、135 项自动化验收。这些条令不规定任何一步怎么做,只规定什么算做完、谁来验、错了怎么升级——这正是 harness 级控制。
给企业做 AI 落地也是同一套思路:先备齐知识和工具,再谈让 AI 干活。单点场景3万起、2-4周上线;多场景组合与长期合作另有分期方案,大项目分期落地控风险——先验证最痛的点,跑通了再扩。
一句话总结:争论"有没有用"时,投票早已结束——9 比 8,票箱公开,源码可查;真正会"没用"的,是写成流程脚本的那种 skill。技术篇1聊过"都说微调已经没用了",判据是 DeepSeek-R1 的流水线;本篇判据是 11 个系统的源码——方法相同:别看口号,看造东西的人在干什么。你手里那份 SKILL.md,就是你的选票。
想把文章里的方法用到你的业务上?


