技术

AI自动编写和发布代码的时代,经验丰富的开发者效率反降19%

Susan Hill

像Devin、Claude Code和GitHub Copilot Workspace这样的软件代理,如今能接收任务描述、读取代码库、编写代码、执行测试直至通过,然后直接发起拉取请求——整个过程开发者无需敲一行代码。由Cognition AI开发的Devin,在隔离的云端环境中完成这一切。在其生产用户群中,它自主发起的拉取请求有67%被合并。Claude Code能读取整个仓库,跨多个文件规划修改,运行测试套件,并在每一步之间无需指令即可迭代。这些工具已投入生产使用,而非停留在研究预览阶段。

它们与早期代码生成工具的区别在于反馈循环。一个建议引擎生成文本后便停止;而自主代理生成代码、运行它、读取返回结果,然后再次尝试。底层框架在各工具间是相同的:一个大语言模型读取上下文——代码库、问题描述、错误日志——生成计划,通过shell命令、文件编辑和git操作等工具执行,读取结果,然后修正。这个循环会一直持续,直到代理成功或耗尽资源预算。

取代编辑器的循环

现有工具在自主性上分为三个层级。在辅助端,GitHub Copilot在开发者输入时建议接下来的几行代码。往上一级,像Cursor这样的多文件编辑器在开发者指导下跨代码库重写,执行开发者指定的修改。在自主端,Devin及同类系统能在较长时间内独立运行,顺序决定读取什么、修改什么、测试什么,仅在遇到系统无法单独处理的审批时才介入。

衡量这些工具进展的评估框架是SWE-bench,由普林斯顿和斯坦福的研究人员创建。它基于来自Django、Flask、scikit-learn等开源Python仓库的真实bug报告来测试代理,并衡量代理能正确关闭的百分比。当前在精选的Verified子集上最高公开得分是96%,属于Claude Opus 5。这个数字代表了真实能力:诊断真实软件bug、编写修复方案,并验证其能通过项目自身测试的能力。

基准测试隐藏了什么

96%的得分附带一个重要星号。SWE-bench Verified从500个精心挑选的任务中抽取。当研究人员应用一种抗污染变体——SWE-bench Pro,使用不可能出现在任何模型训练数据中的问题设计——一个在Verified上得分超过80%的早期模型,在Pro上跌至50%以下。部分基准测试成绩反映的是对评估集的熟悉程度,而非泛化的问题解决能力。这一差距是已知的研究挑战,并非对任何特定工具的批评。

另一项研究发现了一些更难解释的现象。AI安全研究组织METR进行了一项随机对照试验,让经验丰富的开源开发者在自己的仓库上工作。使用当前AI编码工具的开发者比不使用这些工具的开发者慢了19%——尽管他们自己估计快了20%。原因很具体:当代理产生错误结果时,花在重新提示上的时间;合并前花在验证输出上的时间;以及在指挥代理和跟进代理所做工作之间切换带来的认知负荷。基准测试测试的是代理能否在隔离环境中关闭一个定义明确的bug。随机对照试验测试的是开发者在一个实际工作日中是否工作得更快。它们衡量的是不同的东西。

为什么93%的采用率只带来了10%的吞吐量提升

代码自主性在边界明确、定义清晰的任务上表现最佳:一个可复现的bug,输入输出明确;一个函数,规格精确;一个模块的测试套件,行为已定义。当范围扩大到需要隐含架构知识、未文档化的团队约定或产品方向决策的任务时,可靠性会下降——不是因为模型缺乏能力,而是因为这些决策所需的上下文无法放入系统,也无法仅从代码库文件中推导出来。

实际的变化在于工作本身的要求。与自主代理合作的开发者,会花更多时间编写足够精确的规格说明,以便代理执行:详细的问题描述、清晰的测试契约、明确的验收标准。他们会花更多时间审查并非自己编写的代码,这需要一种与编写代码不同的注意力——寻找代理不会自行标记的逻辑错误、安全漏洞和架构漂移。2026年一项对12.1万名开发者的调查发现,93%的人定期使用AI编码工具;同一群体的拉取请求吞吐量大约提高了10%。瓶颈从编写代码转移到了审查代码。

下一个正在积极开发的阶段是能够管理自身任务队列的代理:接收项目规格说明,将其分解为子任务,在专门模型之间委派,仅将需要人类判断的决策提交上来。2026年,多个用于多代理编码编排的开源框架已经发布。但在生产环境中的企业采用仍然有限。Gartner预测,今年启动的代理型软件项目中,相当一部分将在2028年前被终止——一旦团队发现受控演示所展示的与规模化可靠部署所需之间的差距。

标签: , , , ,

讨论

有 0 条评论。