AI 研究
递归自我改进从 AI 理论走进前沿实验室路线图
AP 报道称,领先 AI 实验室越来越把递归自我改进视为近期可能性,Anthropic、OpenAI 和 xAI 都在描述能帮助构建未来模型的系统。
递归自我改进正在从遥远的 AI 思想实验走进前沿实验室的近期规划。美联社报道称,领先开发者现在认为 AI 系统正在接近一个阶段:它们不仅能帮助改进自身,还能参与构建更先进的后续模型。这个概念通常被简称为 RSI,长期以来都是 AI 安全讨论的核心议题,因为它可能加速科学进步,也可能让系统变得更难被人类理解、监控或约束。
近期最清晰的证据来自 Anthropic 对 Claude 在内部研发中角色的披露。Anthropic 表示,在人类监督下,Claude 现在主导了约 26% 的模型研发任务。这个说法并不意味着 Claude 已经能独立设计下一代 AI,但它显示模型正在成为构建未来模型的工具链一部分。在前沿实验室里,编码、评估、数据处理和实验设计的部分自动化,都可能迅速产生叠加效果。
OpenAI 也描述了自动化 AI 研究方面的进展。AP 报道称,OpenAI 宣布开发出一个自动化“研究实习生”,可以在人类指导下完成定义明确的研究任务,其中包括熟练研究人员可能需要数天完成的工作。公司还表示,目标是在 2028 年 3 月前推进更自主的 AI 研究员,但同时承认尚不知道如何安全地达到对齐的完整 RSI。Elon Musk 也曾表示,xAI 的 Grok 开发流程正朝着更少人类参与的方向前进,并把更高自主性目标放在 2027 年。
争议并不在于 AI 能否帮助 AI 研究员,这已经发生。更困难的问题是,反馈循环是否会强到让每一代新系统都帮助构建更强的下一代系统,而下一代系统又进一步改进这一过程。支持者认为,这类系统可能加快医学、材料科学、气候建模和安全研究本身的突破。一个不知疲倦的自动研究员可以测试假设、检查代码、运行实验并发现错误,其规模远超人类能力。
批评者担忧的正是这种加速。如果模型开始改进训练或评估自己的系统,企业可能失去预测能力进展方向的能力。安全研究人员常把失控风险描述为改进速度超过监督速度,使人类测试、理解或干预的时间越来越少。即便是更现实的风险也很重要:自动研究 agent 可能引入细微错误、优化错误指标,或创造难以审计的工具行为。
Microsoft 将自己的方向称为“人本超级智能”,强调系统应被谨慎限制并服务于人类,而不是成为无限制的自治实体。OpenAI 也表示,是否推进快速 RSI 应取决于能否保留人类控制,以及社会能否通过民主方式理解收益和风险。Anthropic 则呼吁其他实验室公布类似指标,说明 AI 在模型开发中到底贡献了多少。
AP 的新报道说明,RSI 已经不再只是哲学式猜想,而是现实治理问题。一旦 AI 成为研发流水线的一部分,企业就需要记录 agent 做了什么、哪些任务经过人类复核、安全系统何时阻止行动,以及模型辅助研究如何改变未来发布的风险结构。递归自我改进也许尚未完整实现,但最初的循环已经足够清晰,实验室、监管者和公众都不能再把它当作遥远情景。