Claude Code Agent Teams实验复盘:16个Agent、10万行Rust、2万美元的成本账
发布时间:2026/9/3 16:07:10
分类:文化教育
浏览:1234

8月下旬Claude Code的Agent Teams功能里出现了一个实验性项目很快在技术社区传开16个Opus 4.6实例自我组织成团队在两周时间里完成了接近2000个工作会话产出约10万行Rust代码——其中包括一个可以编译Linux 6.9内核的C编译器。总费用约2万美元的API成本。这个实验的配置很值得一看16个Agent没有人工指派角色它们自己完成了分工——有负责架构设计的有写核心模块的有专职写测试的还有专门做代码评审的。人类在两周里做的事主要是观察和偶尔回答方向性问题。最关键的细节协作接口从人移到了软件这个实验里有一个变化比写了几行代码重要得多Agent之间的协作接口从人类转移到了软件。传统AI编程的协作模式是人当路由器AI A写完代码交给人人看了再交给AI B测试测试完人再决定是否合并。人是所有协作的中间节点也是瓶颈。而这个实验里Agent之间直接通过结构化的任务看板和代码评审接口协作——写代码的Agent提交评审的Agent把关测试的Agent验证问题以任务形式流转全程不需要人参与。人类只处理目标层的问题不处理执行层的流转。如果这个模式成熟它改变的不只是效率而是软件工程的组织形态——一个开发者可能从管理自己的时间变成管理一个Agent团队。但2万美元的账单藏着三个问题冷静看这个实验暴露的问题和它展示的能力一样多。第一成本结构完全不同。10万行代码2万美元折合每行0.2美元。听起来不贵但注意这是一次性产出成本不含维护。如果这10万行代码的churn率短期内被重写或删除的比例达到行业观察到的AI代码水平——有数据认为AI参与项目的代码churn率比人工项目高39%——那么真实成本要按这个系数放大。第二10万行代码谁审这是更致命的问题。16个Agent两周产出的10万行代码如果要人工审查按每天1000行的实际审阅速度一个人要审4个月。不审就合并这个C编译器是实验品无所谓换成生产系统的支付模块呢产出能力和审查能力的缺口在多Agent模式下被放大到了极限。第三黑箱程度指数级上升。单个AI生成代码时人还能大致跟上它的思路。16个Agent自我组织、互相评审、自主决策时代码的设计理由分散在近2000个会话里没有任何一个人能完整重构出这个系统为什么长成这样。出了问题定位的难度可想而知。全自主和可控执行的分界线这个实验划出了一条清晰的分界线AI工程能力存在全自主和可控执行两个极端中间隔着巨大的工程可靠性鸿沟。全自主多Agent模式适合的场景很明确——探索性、可抛弃、失败成本低的任务比如实验项目、原型验证、技术调研。这次实验本身就是最好的例子它就是一次可抛弃的探索。但企业级Java开发的绝大多数场景在分界线的另一侧生产代码、存量系统、有合规要求的业务。这些场景里“AI能做从来不等于AI做的能用”——差距在于过程是否可控、结果是否可验证、失败是否可回滚。可控执行的核心不是限制AI的能力而是把人的判断力放在关键节点上。任务拆解完之后、接口设计定稿之前、代码生成落地的那一步——每个节点人工确认一次确认成本很低但把整个流程从黑箱变成了白箱。计划模式把自主性装进流程里飞算JavaAI的智能体计划模式提供的正是这种中间形态。复杂任务先自动拆解成多步骤但不是一口气执行完——每一步执行前可视化呈现人可以确认、调整或叫停执行中断点可保存随时续接多步骤之间通过子代理协同但协同的过程对使用者透明。这个设计背后的判断和上面那份2万美元账单的启示是一致的多Agent的编排能力是真实价值但它的正确打开方式是人监督下的流程自动化不是无人化的自我组织。工程场景需要的不是16个AI自我组队的奇观而是一个AI把任务拆成16步、每一步都能被人审查和接管的确定性。16个Agent两周写10万行代码展示的是AI工程能力的天花板。而每天在IDEA里可靠地完成一个个具体任务才是地板——对大多数团队来说把地板做扎实比够到天花板更有价值。