一项针对资深开发者的对照试验发现,使用AI工具后,他们自我感觉效率提升约20%,但实际完成速度却慢了19%。自评与秒表给出的结论完全相反,相差近40个百分点。这意味着,团队管理者长期依赖的“速度感”正在给出误导信号——感觉越快的人,实际越慢。
为什么资深开发者反而变慢
AI主要加速的是“打字”环节,但对一个已经熟悉代码库的资深开发者来说,打字从来不是瓶颈。真正耗时的阶段是设计、推理和审查,而AI在增加这些环节的开销:写提示词、等待响应、检查生成结果。更关键的是,AI的输出常有隐蔽错误,需要更多时间审查修正。METR执行的一项随机对照试验,让16名开源开发者在自己熟悉的代码库中使用前沿AI工具完成246个任务。开发者预期AI会提速,完成后报告大约提速20%,但计时器显示他们实际慢了约19%。这项研究规模虽小,但作者特别指出,最确信自己被提速的人,恰恰是被明显拖慢的人。
影响与后续:团队管理不能再看感觉
从更大规模的数据来看,这一现象并非孤例。Faros AI追踪超过1万名开发者后发现,AI带来Pull Request合并量增加98%、单次PR大小膨胀超过150%、审查时间延长91%,但实际交付量基本不变。31%的PR在未经任何审查的情况下直接合并。DORA的研究也指出,高AI使用率与交付稳定性下降相关,且负面影响持续至今年。GitClear则发现,复制粘贴代码比例上升、代码更替加快,而重构活动降至不足10%。所有这些趋势都指向同一个逻辑:生成变便宜了,审查变贵了。旧瓶颈(打字)被拆除,新瓶颈(审查)浮现。工具市场也在向“审查”转向:今年夏天多家AI编辑器被收购或重组,方向均是“代理主导——开发者从打字变为审查代理产出”。当然,这很可能是J型曲线的低谷期——对新手和新项目,AI确实提升了效率。关键教训是:管理者不能再凭“感觉”来评判效率,而应测量实际交付到生产环境且保持稳定的代码量,并为审查阶段补充人力。那根已经断裂的仪表盘,正在误导整个行业的决策。
编注:信源为个人技术博客,引用METR、Faros AI、DORA、GitClear等多方研究数据,材料侧重实验与效率测量,未涉及具体工具使用方法。样本量较小,读者应注意局限性。