
AI用了有没有效果,怎么证明?这道题的答案,得在上系统之前准备好
证明AI有没有效果,不靠员工感觉,靠基线:上线前用现成报表把现在的数记下来,上线后同口径再比。这杆秤不花钱,但不讲情面——只能在上线前立;错过了,三个月后瘦没瘦就全靠嘴说,谁也说服不了谁。
目录
决定减肥的人,第一个动作往往很有仪式感:办健身卡、买跑步机、下载记卡路里的App。其实都排不上第一。真正的第一步,是今晚洗完澡站上秤,把今天的体重记下来——从这一刻起,你才有了起点。没有那个数,三个月后瘦没瘦,全靠嘴说:你觉得裤腰松了,家里人说没看出来,谁也说服不了谁。
AI项目是一模一样的局。系统上线三个月,老板开会问"咱们这AI到底有没有用":运营说"感觉挺好用",财务说"账上没看出变化",牵头上系统的经理说"同行都上了"。三个人三本账,谁也拿不出证据——问题不出在AI身上,出在上线那天之前:没人上秤。
先把答案放桌上:判断AI有没有效果,只有一个办法——上线前先记下现在的数(基线),上线后拿同口径的数一比。没有之前的数,就没有之后的账。
这杆秤,在项目里的名字叫基线。它不花钱——用现成的报表就能量出来;但它有个不讲情面的脾气:只能在上线前立。这一篇,AI工程师樊军刚把这杆秤讲透:感觉为什么不可信、上线前量什么、错过了怎么补,以及它在谈判桌上的第二个身份。
感觉这块仪表,连老手都会骗
"团队都说AI挺好用",为什么不能当账?因为人对自己效率的感觉,是会整个反过来的。
据METR 2025年7月发布的随机对照试验:16名资深开源开发者,在自己深耕多年的成熟项目上,用2025年上半年水平的AI工具完成246个真实任务——动手之前,他们预测AI能让自己快24%;干完之后,他们仍然自认快了20%;可实测下来,反而多花了19%的时间。
注意这个实验的边界:它说的是当时的工具、资深老手、多年熟地这个特定组合,不是"AI让人变慢"的普适结论。它真正值钱的,是那道落差——连最擅长拿结果说话的资深工程师,在自己最熟的地盘上,体感和事实都能背道而驰。
这正是第56篇聊过的:AI放大判断,也放大混乱——感觉这块仪表,到了AI手里是会失灵的。老手的体感尚且会反向,"用着挺顺手""感觉快多了"这类办公室口碑,更不能拿来入账。仪表失灵,就得换家伙:不问感觉,问秤。
上线前,先把这杆秤立起来
立秤不用上什么统计工程,就两个动作:挑数,记数。
挑3到5个数。标准只有一条:AI上线后,你指望它改变的那几个数。常用的几杆秤——
- 报价响应时长:客户询价发来,到报价单发回去,平均多久;
- 单人日处理量:一个人一天处理多少单、多少份文件;
- 出错率:每百单里错几单、返工几次;
- 加班时长:这个岗位这个月加了多少小时班;
- 询盘转化率:一百个询盘,最后成了几单。
量两周。全部用现成的东西量:ERP里的时间戳、考勤表、工资单、客服聊天记录,都是现成的秤,不用为AI新建任何统计。两周之后,你手里就多了一张纸,白纸黑字写着上线前这摊活的真实水位。
这张纸此刻看着平平无奇,但它有个特性——基线是免费的,错过是永久的:上线之后,再没有干净的"之前"。系统一跑起来,人的活和AI的活就搅在一起了,你再也切不出一段"纯人工"的成绩来对照。秤,只能在上线前上。
已经上线了?账还能补,就这三招
要是你的系统已经跑了仨月、秤一次没上过——不用慌,这账能补。三招,今天就能开工。
第一招,翻历史。上线不会把过去抹掉:上线前的ERP报表、工资单、考勤记录、邮件里报价单的时间戳,全都还在。把上线前那几个月的数导出来,基线就回来了大半——这是最接近"原装"的一招。
第二招,找对照。公司里多半还有AI没碰到的地方:另一条产线、另一个部门、另一个分公司,或者同一个组里还没换工具的那两个人。他们此刻的数,就是活着的"之前"——同一段时间、同一种活,一边用一边不用,比出来的差距,比回忆可信得多。
第三招,量增量。要是前两招都没得用——报表没留、全员都上了——那就从今天起记,比的不是"有AI对比没AI",而是"这个月对比上个月"。AI在磨合、资料在补、规则在调,效果本来就该逐月爬坡;把爬坡曲线画出来,一样能回答"值不值"。
三招凑成一句话:没上过秤,不等于没账可算,只是这道题从送分题变成了应用题——会做,照样得分。补出来的账不如原装的漂亮,但够用。
这杆秤,还是谈判桌上的筹码
基线的第一个身份是记账工具,第二个身份很多老板没想到:它是你谈判桌上的筹码。
跟乙方谈"上线后要做到什么程度"、谈"效果和付款怎么挂钩",每一句都得踩在基线上才站得住。第32篇聊过"按效果付费"这种合作方式——效果的标准,用你本来就在统计的数字。可要是连"之前"的数都没有,这种模式想谈都谈不起:验收那天,你说没效果,他说效果挺好,双方吵的全是感觉,合同帮不上任何忙。
效果不是交付那天验出来的,是签合同那天设计出来的。签约时手里有基线那张纸,验收时它才能替你说话。反过来,这杆秤还在替你筛人:把基线拍在桌上,说"效果就按这个口径、在这个数上比",敢接的乙方是在自我加压——这些要求,换樊军刚AI当乙方,一样照单全收。敢被验收的乙方,才值得签。
所以,别把上秤当成对乙方的防备。它是把"效果"从一门玄学变回一门算术:你有之前的数,他有之后的数,两个数一碰,值不值当场清楚。跟开头那杆体重秤一样——数字不安慰人,但它也不骗人。
这件事怎么落到你的公司
效果验收系列的入口是同一个免费动作:AI项目效果账诊断。把你想上、或者已经上了的AI项目发过来,樊军刚AI出一页意见:五个口袋怎么数、上线前该记哪些基线数、验收线怎么定——这件事免费。
想直接跑起来的公司,从单点场景起步:樊军刚AI的单点场景3万起、2-4周上线,上线前先陪你把基线量好,跑出来的效果才有账可对。多场景组合与长期合作另有分期方案;大项目分期落地,风险锁在每期几万。更多案例见官网 fanjungangai.com。
上一篇教你数钱:AI的回报只会从省人、省时、增收、避损、提产这五个口袋回来,一个口袋一个口袋数。这一篇给了那杆秤:口袋里的数,得有"之前"和"之后"才成账,而"之前"只能在上线前记。下一篇去一个最容易看走眼的现场——演示。样片为什么总是那么漂亮?因为试驾的路,是销售挑好的。怎么看演示才不被晃了眼,下一篇讲。
想把文章里的方法用到你的业务上?


