同一个AI,为什么有人用成团队,有人用成玩具?一百行代码和十万行代码,考出了差不多的分数
AI开发实战行业场景

同一个AI,为什么有人用成团队,有人用成玩具?一百行代码和十万行代码,考出了差不多的分数

樊军刚樊军刚AI 2026年9月5日8 分钟阅读
结论先说

同一个AI用成团队还是玩具,差的不是模型,是围着模型的那套环境。模型是给定的,杠杆全在环境——纠结换模型之前,先看看围着模型的七格。

目录

同一个模型,有的公司用出"一个团队"的产能:报价、比价、质检一环扣一环;有的公司用成"一个玩具":新鲜两周,然后躺在收藏夹里吃灰。

差距在哪?2026年9月,一篇发表在arXiv的论文(编号2609.00006)读完了含Anthropic、OpenAI、Google官方产品在内的11个生产级编码智能体的源码:极简系统Mini-SWE-Agent全部代码约100行,同一批研究对象里的产品级系统,代码量到了百万行级;而论文指出,这个百行系统在行业公认的编程考卷SWE-bench Verified上的成绩,与比它大三个量级——也就是十万行级——的系统处于同一区间。

论文自己加了句注:自报数据、模型与日期不同,不能当严格排名。但即便算上这句注,问题依然成立:约100行就能上考场,多出来的十万行、上百万行在干什么?

这套"模型之外的东西",行业今年给了它正式的名字:harness(行业术语,直译是马具、缰绳——第09篇把它译作缰绳);这门学问叫harness工程——论文的说法是,这个词2026年2月进入流通,2026年初被命名为一门学科。

先把答案放桌上:模型是给定的,杠杆全在环境。同一个AI用成团队还是玩具,差的不是模型本身,是围着模型的那套环境。论文把它写成一个等式:Agent = Model + Harness(智能体=模型+harness),2026年初由LangChain的工程系列文章推广开来。模型你改不了,能拉开差距的全是harness。

把宇航员活着带回来的,不是宇航员

1970年4月,阿波罗13号服务舱氧气罐爆炸,三名宇航员被困在飞往月球的途中。"休斯顿,我们出了问题"——这句呼救是说给地面听的;把他们活着带回来的,是休斯顿的地面控制中心。

地面看得见:遥测把每个读数传回来,地面比宇航员更清楚飞船状态;地面有知识:飞行规程和检查单在手边,随时可翻;地面有边界:什么情况必须中止,规则事前划好;地面有分工:各岗位飞控各司其职。

最关键的一幕在回程:舱内二氧化碳浓度升高,地面用飞船上现有的材料,现场设计出一套过滤器适配方案,再一步步念给天上照做——方案在地面生成,动作在天上执行,结果传回地面验证。

三名宇航员活着回来了。拆开看:宇航员是模型,地面控制中心是harness。模型再强,缺了那套看得见、有知识、有边界、有分工、有闭环的环境,也只是困在铁罐里的高手。

harness到底是什么?模型之外的一切,一共七格

论文的定义很干脆:harness是模型之外的一切——把模型接到世界上的运行时。论文(2026年9月版本)把它拆成七个子系统,外加界面层、会话底座两个横切面,翻译成老板的话是七格:

  • 干活的循环:干完一步想下一步,直到活干完;
  • 接模型:模型从哪来、怎么调、贵了怎么换;
  • 工具:AI伸手够得着的东西——查库存、读单据、发消息;
  • 记忆与上下文:干活时看得见、记得住的材料;
  • 安全与权限:什么不能碰、碰之前谁签字;
  • 编排:分身术——一个AI派活,一群AI干活;
  • 扩展:手册、插件这些给AI"加本事"的口子。

七格合起来只干一件事:让AI看得见、做得了、错得起、错了能发现。第09篇聊过的"缰绳四件套"——权限、审批、留痕、兜底——就是其中"安全与权限"那一格。

多出来的几十万行花在哪:全在管"出了错怎么办"

先说透那个数据。Mini-SWE-Agent用约100行就实现了全部七个子系统:一个循环、一个模板、一个工具、一条消息列表、两个上限,没有编排——说明原理不难,地板很低(口径不变:自报数据、模型与日期不同)。

那多出来的几十万、上百万行在管什么?论文的判断是:区分地板与生产系统的,从来不是"能不能完成任务",而是安全、恢复、成本管理、可扩展性与平台化界面——一句话,全在管"出了错怎么办"。

据OpenAI Codex团队2026年公开分享(本文依据公开转述):一个真实产品,约5个月、约100万行代码、人工手写零行、约1500次代码合并;产品有内部员工每天用,也有外部试用者。

团队里人只做三件事:设计环境、说明意图、建反馈回路。架构约束不写进提示词当告诫,写成自动检查器和结构测试,报错信息本身就是"怎么改"的说明;文档即知识库,给AI看的总说明就是目录;评审也是AI审AI,人工评审变成可选。

注意分工的变化:人从"写行为"变成"设计环境"——一个报错附修法说明的检查器,胜过提示词里一百条"禁止"。

程序思维穷举路径,harness思维塑造决策空间

第57篇聊过两种思维:程序思维要消灭不确定性,AI原生思维学会跟不确定性打交道。这篇接着说:harness思维落到工程上长什么样?

程序思维穷举路径,把每种分支提前写死,真实任务永远有脚本没想到的变体,越写越脆;harness思维不穷举路径,塑造决策空间——让好路径容易走,坏路径机械上走不通或立刻可见。该写死的(权限、门禁、检查器)必须写死,确定性动作下沉成脚本,工作流在这层是好零件;不该写死的,留给模型。

四句落地的话。

第一,模型是给定的,杠杆全在环境。同一个模型换套环境,结果天差地别——预算投环境,常比投"更聪明的模型"更值钱。

第二,不在环境里的知识,对AI等于不存在。报价规矩躺在老师傅脑子里,对AI就是没有;写进它能查的手册,才算有。

第三,机械约束优先于口头告诫。能变成权限、门禁、检查器的,别写成"请注意""严禁"。

第四,没有闭环的AI不是员工,是生成器。干活没人验收、出错没人发现,产出再多只是生成;第56篇聊过:AI放大判断,也放大混乱。

名片上那个词,我自己天天在跑

樊军刚AI的交付方式就照这套环境建——名片上印着"自研AI军团Harness协作体系",说的正是它:"军长"AI规划调度,"士兵"AI并行施工;军规是写死的条令铁律;一道反幻觉防线——不采信"已完成"的自报、交活必附测试原始输出、施工和质检不是同一个脑子、失败逐级升级;再加135项自动化验收随时体检。

关键在条令规定的是什么:不规定任何一步怎么做,只规定什么算做完、谁来验、错了怎么升级——这就是harness级的控制。

第15篇聊过这支军团怎么编队,这篇讲它为什么能编:军长和士兵都是AI模型,把它们编成军队的是那套环境。特别篇3给过一道乘法:产出 = 认知 × 工具——harness就是把"认知"固化进环境的那一层。

你不用造环境,但要会问三句话

这听着是技术团队的事,跟老板有什么关系?关系在于:你不用亲手造harness,但要会查供应商和团队有没有。第81篇把派活压成一句话:给AI派活,说三样、备两样:说目标、标准、边界,备知识、工具。三句不懂技术也问得出口:

第一句:AI出了错,你们怎么发现?"我们会测试"不算答案——测什么、谁来测、测不过怎么办,答到这层才算。

第二句:什么不能碰,是拦住的还是提醒的?记住分工:边界事前拦,标准事后验。"不许删数据"写进提示词提醒AI,等于没拦;变成权限和门禁,机器事前拦下,才叫边界。

第三句:干完了谁验、验什么?验收标准是能逐条检查的(数字、条数、通过率),还是一句"做得不错"?

三句答得顺,环境里多半有货;支支吾吾的,你买到的可能是个玩具。这也不是刁难,真有环境的团队答起来不费劲——樊军刚AI自己天天被这三句问:出错靠135项自动化验收和独立质检发现,不能碰的靠机械拦截,干完按验收标准逐条验。

这套环境不是大厂专属。AI工程师樊军刚给企业做AI落地,价格摆在明处:单点场景3万起、2-4周上线;多场景组合与长期合作另有分期方案,大项目分期落地、风险锁在每期。

一句话总结:同一个AI,用成团队还是玩具,差的不是模型,是围着模型的那套环境——看得见、做得了、错得起、错了能发现。1970年4月把宇航员带回来的,是休斯顿的地面控制中心;2026年,行业给它起了学名:harness工程。模型是给定的,杠杆全在环境——纠结换模型之前,先看看围着模型的七格。

想把文章里的方法用到你的业务上?

免费聊聊需求