产品动态

AI 开发软件该管到哪里?Berkeley RDI 三级框架拆解自主边界

Berkeley RDI 把软件自主开发拆成代码自主、流水线自主、需求自主三级,给能力声明和部署选择提供了一个可对照的刻度,对中文用户判断 AI 编程工具的真实位置很有参考价值。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
AI 开发软件该管到哪里?Berkeley RDI 三级框架拆解自主边界

当 AI 写代码变得越来越顺手,一个更现实的问题浮上来:软件开发的哪些环节可以让 AI 自己拿主意?UC Berkeley 的可靠自主智能研究所(RDI)最近给出了一个三层框架,试图把这件事拆清楚。

这份框架发布的时间点值得留意。过去两年,Cursor、Copilot、Claude Code 等工具已经把“写代码”大幅提速,瓶颈从打字能力转移到了产品决策。研究者认为,正因为代码本身不再是稀缺资源,“决定写什么”反而成了新的关键能力。

框架把软件自主开发分成三个级别。最轻的一级叫“代码自主”:AI 负责设计和实现,人类决定要构建什么,并审核每一次 PR。这种模式其实已经在大量团队里跑了大半年,差别只是没人给它一个正式名字。

三个级别各自停在哪里

第二级“流水线自主”更进一步:AI 跑通从设计、编码到部署的全流程,人类只在最后评估结果是否达标。这是少数激进团队正在尝试的方向,但边界依然模糊——什么叫“评估结果”、谁来兜底,仍没有共识。

第三级“需求自主”是最激进的一档:AI 自主决定要构建什么、写给谁、解决什么问题。这一级别目前几乎停留在论文和演示里,离真实部署还有明显距离。

框架的核心价值不在分级本身,而在于把“能力声明”和“部署选择”挂钩。如果一个产品宣称自己能“全自动开发”,但实际只能跑到第一级,市场和监管就有了可对照的刻度。这种刻度对企业采购和合同条款都有直接影响。

对开发者和团队意味着什么

对一线开发者来说,这个框架更像一面镜子。多数人今天的真实处境是“AI 写了 80% 的代码,但决定写什么、为什么写、要不要上线,依然是人类在做”,也就是停在第一级。这意味着“被 AI 取代”的争论焦点,不在代码速度,而在决策权怎么交出去。

对企业 IT 和采购方而言,三级框架给出了一个可写入 RFP 的清单:要求供应商明确说自己处于哪一级、提供何种人类把关节点、事故责任如何划分。采购方第一次能用同一把尺子衡量不同的 AI 开发平台。

中文用户应该关注的两件事

一是国产 AI 编程工具的对标位置。智谱、通义、DeepSeek 等团队的代码模型能力已在快速追赶,但能公开说清楚自己“自主级别”的产品并不多;用户试用时可以主动问一句“你们现在停留在哪一级、人类在哪个环节介入”。

二是私有部署的现实边界。即便模型能力够,把代码和业务逻辑完全交给流水线或需求自主,仍涉及权限、数据合规与审计问题,多数国内团队短期内更适合停留在第一级,并在 PR 审核上投入更多精力。

后续值得观察的点

接下来可以留意三件事:第一,主流云厂商是否会把这个分级写进自家服务描述;第二,开源社区里是否会出现“自主级别”标签,类似于模型的 License;第三,当 AI 真的开始决定要构建什么,相关争议和判例会在哪里率先出现。

同主题阅读路径

查看「产品动态」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具