AI 把写代码变成了小事,需求定义和流程治理才是新门槛

去年有段时间我天天盯着 Cursor 和 Codex 的生成速度看,觉得代码写得越快,项目就能越早上线。

后来才意识到,这种想法跟盯着打印机转速判断一个公司的出货速度差不多。

我参与过的一个后台项目,AI 帮忙把接口代码生成完了,一个下午搞定。但后面光是等评审排期、拉安全合规确认、再等发布窗口,又拖了两个多礼拜。那段时间我一直在想一个问题:代码都自动生成了,为什么项目还是那么慢?

代码生成快了,为什么项目还是那么慢

我后来去翻了 Google、OpenAI、Anthropic 和 LangChain 在 2026 年各自发布的研发流程报告,发现四家不约而同指向同一个结论:AI 对软件工程真正的冲击,不是让程序员少写几行代码,是逼着企业把整条开发流程重新设计一遍。

四家的结论高度一致,但角度各不相同。

Google 的报告从范式框架出发,讲的是开发流程怎么从 vibe coding 走向 agentic engineering。它的核心判断不在「AI 能不能写代码」,而在「AI 写出来的代码周围,有没有足够完整的规格、测试、约束和反馈机制」。换句话说,代码本身已经不是问题,代码周围的治理才是。

OpenAI 把重点放在了团队分工上。它提出 Delegate、Review、Own 三种角色重新划分人机边界:Agent 承担第一轮分析和机械性执行,人类负责复核完整性,继续拥有产品意图、架构取舍和生产风险的最终决定权。

Anthropic 从企业落地的角度走了一条更实的路:把每个研发阶段都拆成可版本化的制品文件,从意图文档、需求规格到计划文档,一路流转下去,既是人的交接物,也是 Agent 的执行依据。

LangChain 延伸到 Agent 产品的生产运营。它特别点出一个被多数人忽略的问题:传统监控只看服务是否正常运行,但 Agent 监控还得回答一个新问题——Agent 是不是选了正确的工具、走了正确的路径、用了正确的上下文。

这四份报告来自不同公司、不同视角,但它们共同推导出同一个判断:代码生成正在从稀缺能力变成基础能力,真正的瓶颈已经转移到需求定义、验证验收和流程治理上。

其实 Anthropic 的内部数据更吓人

Anthropic 的 SDLC 手册里披露了一组数据:Claude 已经写出了他们 80% 以上的合并代码,工程师的人均季度产出是 2021 到 2025 年基线的 8 倍。

这个数字说明什么?说明在他们自己公司内部,代码生成这件事已经彻底不是瓶颈了。

但问题来了。代码写得快了,后续的评审、测试、安全检查和部署流程并没有同步提速。结果就是:代码生成只要不到半天,但评审排队、多方确认、等发布窗口这些环节,还是按照老节奏在跑。

Anthropic 的解决方案是把传统的线性开发流程,改成六阶段循环。

第一个阶段是规划,核心是一份叫 intent.md 的文件。跟传统流程不同的是,这份文件用提出者自己的原话写成,不做多次转手。传统流程里一个想法要穿过积压项、用户故事和需求梳理会,每次交接都会损失信息。到了工程师手里,早就不是提出者最初的意思了。intent.md 把这整条链压成一页,AI 负责追问边界,人类负责拍板优先级。

第二个阶段是设计。传统流程里需求和设计分属不同团队,两次转述两次损耗。AI 原生流程把两项合并到一次会话,由 Agent 根据 intent.md 直接生成需求与设计规格文档,人类只做审改。

第三个阶段是构建。工程师用 Claude Code 的规划模式(plan mode),先只读代码库、不写任何改动,反复拷问「这个改动可能破坏哪些部分」,直到一个从没看过对话的人也能照计划实现,才把计划提交后开始编码。

第四个阶段是测试。Anthropic 要求每场会话在代码交出之前先跑一轮自查,包括测试、lint 和必要的视觉检查。更关键的是建立评估套件:从近期真实任务里选 20 到 50 条,每条写明什么算「通过」,在 CI 里自动跑。CLAUDE.md、skills 或钩子有任何改动就触发,通过率下滑的改动必须先评审再合并。

第五个阶段是部署。技术负责人把评审标准写进 REVIEW.md,PR 自动生成后由另一个独立的 Claude 实例异步复核。这个实例不继承编写代码的上下文,避免同一个错误前提继续自洽。生产发布只由具名发布经理执行,分支保护保证任何改动都必须走 PR。

第六个阶段是维护。一个持续运行的监控 Agent 可以在指标异常时自动生成 intent.md,再依次经过需求、计划、构建、测试和评审各阶段,全程不需要人工介入。整个流程形成一个闭环:Intent → Spec → Plan → Build → Verify → Review → Deploy → Observe → New Intent。

Anthropic 给了一句总结:Skills make violations rare,hooks make them nearly impossible。技能让违规变得少见,钩子让其几乎不可能。前者是建议性的,后者是确定性的。

四家公司分别补上了哪一层?

把 Anthropic 的流程框架放到更大视野里看,四家公司其实各自补上了一块。

Anthropic 用制品文件串起了完整的研发生命周期,从 intent.md 到 PR 和事故记录,每个阶段都有版本化的交接物。

Vercel 在 8 月展示了他们为 AI SDK 搭建的 Software Factory。运行四周后,Factory 参与编写了 35% 的合并 PR。他们的 Factory 按 issue 类型分流:Bug、Feature、Documentation 分别由不同的 Agent 处理,互不干扰。整个链路里,不同 Agent 分别负责分类、分析、实现和审核,通过制品交接,不必让每个 Agent 共享同一段越来越长的聊天历史。

Warp 的方向更激进:把 Factory 做成基础设施即代码。仓库、Agent 角色、模型、权限和触发器都进入版本控制,修改 Reviewer 模型或收紧权限,可以像基础设施变更一样走 review、canary 和 rollback。他们还把 Factory Agent、Scorer 和 Improver 分开:执行 Agent 做任务,Scorer 按成本和质量评分,Improver 提出修改建议,但 Agent 不会私下重写自己。

OpenAI 的 Symphony 解决的是另一个问题:多数工程师同时管理三到五个 Agent Session 后,context switching 就开始抵消效率提升。Symphony 让 Linear issue 成为控制面,工程师管理任务,Orchestrator 负责启动 Session、创建 Workspace、限制并发。

四家拼在一起看,Software Factory 的工程轮廓就很清晰了:任务进入系统,经过分诊、规格、风险 Gate、隔离执行、验证、人工审批和反馈闭环,最后交付并回收反馈。

代码自己会写但流程要从头设计

Software Factory 的概念还在早期,但已经有人跑出了第一个完整案例。

Cole Medin 是一个深耕 AI 编程工具链的博主。他提出了一个叫 dark factory 的概念:把 PRD 扔进去,系统自己拆任务、派 Agent 写代码、自动审 PR、合并分支、部署上线。从需求到交付,没有一个人审阅过代码。

为了验证这条路走得通,他做了一个叫 Dynachat 的 AI 导师应用。整个应用从零到上线,他没有写、也没有看过一行代码。目前应用还在生产环境运行,可以试用。

当然,Dynachat 本身不复杂,不能证明 dark factory 能处理所有项目。Cole 自己也很克制,说这是在验证工厂的成色,不是在宣布 AI 可以取代所有工程师。

他引用了一个五级自治度的分类框架。L1 是代码基本由人写,AI 只做少量辅助。L3 是 Agent 写全部代码,人深度介入每个任务的规划与验收——这是目前最实用的档位。L5 是人只给高层方向,方向盘已经拆掉,规划文档进去,成品代码出来。他坦言自己教的主要是 L3,但软件工厂的目标是把可靠性做到 L5 也能成立。

为什么恰好是现在?三样东西凑到了能用的节点:Coding Agent 已经能独立写代码,大模型能接住更长更乱的需求,harness(把 Agent 框进固定流程的外围装置)成熟了。单看任何一样都不够,串成流水线后才从设想变成能落地的事。

Cole 目前把整套方法打包成一个开箱即用的开源软件工厂,装好就能用,同时留着旋钮供人按自己的习惯调整。他说他判断交给工厂还是留在手上,看的是 harness 做到多硬。需要高可靠的任务,人还是要多留在环内。

真正的机会在哪?

四份报告、一套六阶段框架、三家大厂的 Software Factory,再加上一个开源的 dark factory,这些信息摆在一起,指向一个判断:AI 写代码这件事正在快速通货膨胀,写代码本身的价值在下降,但定义清楚要做什么、验证做出来的东西对不对、治理这条流水线本身的能力,正在快速升值。

对个人和小团队来说,这其实是个好消息。你不需要写出最优雅的代码,但你需要学会用 intent.md 把需求讲清楚、用评估套件把验证做扎实、用 hooks 把边界守死。这些能力不需要大厂资源,一个人就能开始练。

Anthropic 的手册建议从建立 intent/ 目录、写好 CLAUDE.md、手工跑通两三个循环开始。等流程顺畅了,再逐步把闸门交给 hooks 和 CI。

从打印机的速度回到项目本身,卡住你的从来不是代码写得慢不慢,而是整条链有没有设计过。现在链上的每一个环节都在被重新定义,最早动手把这条链理顺的人,会先拿到结果。

展开阅读全文

更新时间:2026-09-18

标签:科技   门槛   小事   定义   流程   需求   代码   阶段   工程师   项目   传统   测试   框架   规格

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top