AI编程洪流:人类审核已跟不上代码生成的速度

2026年8月3日

99

327

AI编程洪流:人类审核已跟不上代码生成的速度

当旧金山的广告牌还在描绘着AI将替代人类工程师的美好愿景时,OpenAI内部的实况却给出了另一种答案:工作没有被自动化掉——它涨了,涨成了一场洪水。GPT-5.5发布数周内,OpenAI内部代码工具Codex的采用率已接近100%,数据平台团队的代码审查量一年增长了5到10倍,5000多名员工开始使用内部数据分析Agent直接查询数据仓库。这些数字背后,一个前所未有的挑战正在浮现:AI大幅提升了代码生成效率与产量,但人类审核系统的运转速度已远远落后于代码生产速度。

概述

这轮代码洪水中,相当一部分来自不写代码的人。运营人员开始生成Flink数据流任务,产品经理周一早上就能带着周末用AI做出的原型来上班。任何人——哪怕完全不懂编程——都能借助AI工具快速产出代码。数据平台负责人Emma Tang描述了一个典型场景:「我们有用户在生成Flink作业,但他们根本不懂Flink。」 问题在于,代码出了问题,作者自己往往讲不清交付了什么。一个靠「氛围编程」(vibe coding)开发出的应用可能每几秒刷新一次数据,而它依赖的分析系统一天才更新一次。要真接上生产系统,「跑在哪」「谁维护」这些关键问题,写代码的人根本看不见。Tang说得直白:「没人认领这些代码了——除了我们。」 这揭示了AI编程时代最核心的悖论:AI把代码的生产权分发给了所有人,却没有把责任一起分发出去。生产权扩散了,维护责任却仍然沉积在原来那几个人身上。真正淹没OpenAI的不只是代码——是无人认领的责任。

生产权扩散,责任却原地沉积

应用基础设施VP Venkat Venkataramani给出了一个判断:今天的洪水,回头看只是毛毛雨。不远的将来,过去一年的事故量可能压进一周发生。危险不在于代码数量的增加本身——高质量代码多了,只是软件变多了;真正的危险在于洪水夹带的东西:bug、安全漏洞、藏在海量变更里的隐患。哪怕污染比例不变,当水量放大10倍、100倍,绝对量就是灾难。 现有的两道传统闸口——CI(持续集成)和CD(持续部署)——是前AI时代按人类写代码的速度设计的。当被问到能否扩容CI/CD时,这位VP的反问切中要害:「你只是让每天多灌进来100倍的代码——然后呢?」扩容管道不会让水变干净。 「验收」从来不只是测试资源的问题,它至少涉及三层含义:确认代码做的是不是原本想做的事,确认它不会伤害别的系统,确认出了问题谁负责。而这三件事,对应着三层难以突破的天花板: 吞吐量天花板——代码量涨十倍,reviewer不可能也涨十倍;理解力天花板——审查者面对的,不再是作者想清楚才提交的代码,而是作者自己也没完全消化的AI生成物;责任天花板——测试全绿、上线出事,后果算谁的?AI可以把一行代码复制一千份

AI可以把一行代码复制一千份,却不能把理解和责任复制一千份。代码可以并行生成,责任却仍然串行结算。

“行业观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

验收系统的三重天花板

那位VP提出的方案,类似于现代城市的雨洪管理:不靠一个下游闸口,而是在多个位置分层过滤。「你加10层这样的过滤,最后总能拿到干净的水。」 第一层是源头立规矩。数据平台团队的工程师现在修完故障后,会顺手把经验写进公司共享的Codex指令,让AI下次自己不犯同类错误。第二层是专职审查Agent——写代码的Agent只管写,审查Agent按系统属主团队的规矩审核,大变更要过十几个子Agent的完整流程。第三层是全天候监控Agent,不看代码看行为,盯着运行中的系统,在问题扩散前隔离它。第四层最激进:哪怕前面所有关卡都亮了绿灯,基础设施本身可以拒绝执行不安全的操作。 这里发生了一次双向迁移:重复、稳定、说得清规则的判断,被写进Skill、审查Agent和基础设施,往下沉;模糊、冲突、要担后果的判断,往人身上移。那位VP有一个预判:code review会逐步让位给prompt review,再让位给plan review。工程师最终审的不是代码,是意图——先是需求规格,再是架构文档,最后是业务问题本身。 一个值得注意的细节是:即便已经上了生成Agent、审查Agent、十几个

四层过滤:让判断力分层下沉

尽管没有人有完整解法,但在GOSIM全球开源创新汇的Agentic Software Engineering会场,一个来自dora-rs的案例给出了值得关注的思路。dora-rs是一个开源的机器人数据流框架。此前的开发账本是:两位顶尖工程师,四年半,写出约4万行Rust代码。2026年2月起,一位资深架构师带着一队Agent,用两个月把代码库翻倍重写到8万行,打出1.0的候选版本。这活原本需要两个工程师干2到3年。 但这位架构师强调的不是速度本身:「速度本身证明不了什么——谁都能快速生成代码。关键是可信度。」可信度是怎么工程出来的?他总结了三条实践,每一条都直接对应对前面提到的三层天花板。 第一条,Agent进场之前,先修了一年验收基础设施。分层QA、变异测试(故意往代码里塞错,看测试网能不能兜住)、覆盖率闸口,都是提前铺好的。他的结论很直接:「真正承重的是基础设施,不是模型。」 第二条,把测试写成Agent的合同。TDD直接写进AGENTS.md规范:先写挂掉的测试,再写最小实现。结果是,这个仓库里非示例代码的28%是测试——用他的话说,Agent写的大部分代码,是

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI