AI消息速览

388个AI生成的PR、180个被合并:Claude之父的“人审AI”维护实验

事件日期 2026-04-14 · 产业观察 · 已接受

事件日期2026-04-14
信息日期2026-04-14
入库日期2026-08-16
通道产业观察
状态已接受
来源新智元

知识卡片:388个AI生成的PR、180个被合并:Claude之父的“人审AI”维护实验

英文标题(原文为中文,此为译名):388 PRs All AI-Written, 180 Merged! “Father of Claude” Says Programmers Only Have to Sign Off

英文关键词:AI code review; Claude Code Routines; PR bottleneck; AI-generated code; developer productivity; Rust LLM policy

原始来源:https://aiera.com.cn/2026/08/16/other/admin/109319/388%e4%b8%aapr%e5%85%a8%e9%83%a8ai%e6%93%8d%e5%88%80%ef%bc%8c180%e4%b8%aa%e5%b7%b2%e5%90%88%e5%b9%b6%ef%bc%81claude%e4%b9%8b%e7%88%b6%ef%bc%9a%e7%a8%8b%e5%ba%8f%e5%91%98%e5%8f%aa%e5%89%a9%e4%b8%8b

一句话结论

在Anthropic内部的一次“让Claude接管自家App日常维护”的实验中,AI生成了388个PR,其中180个被合并;人类工程师的主要工作不再是写代码,而是审查和决定是否合并。产业链上的瓶颈正从“写代码”转移到“审代码”。

事件概述或研究问题

Anthropic工程师Boris Cherny在X上公布了一个持续数周的“奇怪实验”:让Claude通过一个名为proj-claude-maintains-apps的Slack频道,每天自动维护Anthropic的App。实验覆盖iOS、Android、桌面端、Web、CLI和Agent SDK六类环境,每条线一个独立Routine,进展发到频道顶层线程。Claude像同事一样定时上班、找问题、改代码、提PR,等待人来审查。

它接管的活包括:崩溃巡检、重复抽象合并、死代码清理、抽象泄漏修复、清理恒过测试、修复时好时坏的测试、移除全量上线开关、按使用量决定内部功能去留等。文章称共“十一项活”,没有一项是“做个新东西”,全是日常维护中“最不愿意干、干完也不出绩效”的脏活。

方法/产品要点

  • Claude Tag(入口):挂在Slack频道中,被@时响应,也会在权限和指令允许时主动接活。2026年8月13日刚做过一次升级,使其能结合整个频道上下文判断何时出手。
  • Routines(执行层):2026年4月14日推出,配置好提示词、代码仓库和连接器后,按时间表、API调用或GitHub事件触发,运行在Claude Code的云端设施上。
  • Claude Code Review(审查层):AI负责找问题、改代码、开PR,全程不需要人批准;但每一处变更停在PR里,是否合并进主分支、是否上线,最后必须由人确认。
  • 调优方式:Boris面对某一类PR不过关时,不逐个修改失败的PR,而是回头修改生成这些PR的Routine,再观察几天。即“不修结果,修规则”——提示词被当作长期运维的资产来养。

主要结果或产业意义

  • 实验数字:388个PR全部由AI生成,180个已被合并
  • Anthropic称,过去一年公司人均代码产出增长200%,代码审查成为瓶颈。
  • Faros AI《The Acceleration Whiplash》报告(覆盖2.2万名开发者、4000多个团队,两年遥测)显示,高AI采用度下:人均epic完成量涨66.2%,任务吞吐涨33.7%,PR合并率涨16.2%;但每周部署上线的次数降了11.7%。
  • 代价转移到开发者身上:每人bug数涨54%;每个PR对应的线上事故涨242.7%;合并后又被删掉的代码比值涨861%;PR平均体积涨51.3%;等待审查的中位时长涨441.5%;未经一次审查就合并的PR多出31%。
  • Anthropic的Claude Code Review效果数字:采用前仅16%的PR能获得实质性审查意见,采用后为54%;超过1000行的大PR有84%能被查出问题(平均7.5个),50行以下小改动为31%(平均0.5个);工程师标记为“找错了”的发现不到1%;审一个PR平均跑20分钟,烧掉15–25美元token。

为什么重要

这标志着AI编程从“辅助生成代码”走向“自主维护代码库”的实践:AI能自己发现问题、改代码、提PR,人只保留最终合并权。随之而来的关键是——生成侧已不缺产能,缺的是审查侧:谁先看、哪些重复、最后谁签字。工程师的身价评估也从“写得多快”转向“审得多快”。

与既有脉络的关系:已有卡片多关注AI基础设施中间层和平台化趋势,本条提供了更具体的一线量化证据:代码审查成为新的瓶颈环节,也呼应了“AI提PR、人来做QA”的基础设施演进方向。

局限与不确定性

  • Boris Cherny被称为“Claude之父”的说法来自文章标题,文中未提供其具体职务或该项目在Anthropic内部的代表性,待核实
  • 原文章称实验包含“十一项活”,但正文仅列举了其中八项左右,完整清单待核实
  • Faros AI报告的变化数字(66.2%、33.7%、16.2%、-11.7%、54%、242.7%、861%、51.3%、441.5%、31%)所用对比基准和统计口径在材料中未完整展开,待核实
  • Anthropic Code Review的“上线前/上线后”对比,原文表述较为简略,具体对照条件待核实
  • 实验持续数周、样本有限,长期效果和代码质量影响尚不清楚;AI提PR是否真的“越跑越顺”也仅来自Boris个人观察。

可用于图书/PPT/简报的角度

  • “AI不是替代程序员,而是重新分配工作:生成归AI,审查归人。”
  • “写代码变便宜了,审代码变贵了。”
  • “AI每天上班干的都是脏活:打扫代码库,而非创造新东西。”
  • “不修PR,修Routine——提示词变成需要长期运维的资产。”
  • “Rust给AI代码立规矩:先声明、不碰关键路径、维护者可直接关掉AI的PR。”可作为AI代码治理的对照案例。

原始材料

  • 新智元报道,2026年8月16日,AIERA发布:https://aiera.com.cn/2026/08/16/other/admin/109319/388%e4%b8%aapr%e5%85%a8%e9%83%a8ai%e6%93%8d%e5%88%80%ef%bc%8c180%e4%b8%aa%e5%b7%b2%e5%90%88%e5%b9%b6%ef%bc%81claude%e4%b9%8b%e7%88%b6%ef%bc%9a%e7%a8%8b%e5%ba%8f%e5%91%98%e5%8f%aa%e5%89%a9%e4%b8%8b
  • 文中引用:Boris Cherny的X帖子(链接见原文)
  • 文中引用:Faros AI《The Acceleration Whiplash》报告PDF(链接见原文)
  • 文中引用:Rust项目LLM政策博客(2026-08-05,链接见原文)