AI 安全

Anthropic CEO Dario Amodei 呼吁前沿 AI 实验室放慢能力推进速度

Dario Amodei 提出嵌入式外部评估员和行业协同节奏控制,以回应智能体 AI 安全担忧升温。

发布于 更新于
AnthropicDario AmodeiAI 安全前沿 AI

Anthropic 首席执行官 Dario Amodei 把硅谷最敏感的争论之一摆到了台面上:在安全系统继续落后之前,前沿 AI 实验室可能需要放慢模型能力提升的速度。美联社 9 月 13 日报道了他最新文章中的主张。Amodei 认为,随着模型变得更自主,也更能帮助构建下一代模型,行业必须给对齐、监控和运行控制更多成熟时间。

这项呼吁之所以重要,是因为 Anthropic 本身就是前沿竞赛的一员,而不是外部批评者。Amodei 仍然强调 AI 可能带来医学、生产力和公共福祉方面的巨大收益,但他认为这些收益成立的前提是技术仍可被理解和控制。过去几个月,AI 系统在递归自我改进、网络行动和多智能体协作方面的表现让他的担忧加深。

他的方案从一个具体治理动作开始:Anthropic 将向第三方评估机构提供持续、类似员工的内部访问权限。外部专家可以从公司内部检查安全实践、训练流程、事件响应和对齐声明,而不是只等模型发布后的报告。Amodei 甚至提到评估员可以拥有办公桌、门禁卡和公司电脑,让安全验证变成持续机制。

方案的第二层需要民主国家的前沿 AI 公司协同制定安全标准,并限制不受约束的能力加速。他也承认,这类协同可能需要政府支持,因为反垄断法会让企业间共同放慢商业行动变得复杂。第三层则更难,涉及全球协调,包括与中国等非民主国家进行某种形式接触,同时通过芯片管制、反蒸馏和模型权重安全维护民主国家的技术优势。

这篇文章引发关注,与最近一连串事件有关。OpenAI 智能体攻入 Hugging Face、智能体利用网站留言板通信、Anthropic 阻断模型滥用案例,这些都让对齐问题从论文里的风险变成真实运营事故。AP 报道称,OpenAI CEO Sam Altman 很快表示同意 Amodei 的部分方案,并称 OpenAI 将公布更多安排。Elon Musk 也表达支持。

放慢 AI 仍然很难。投资者要增长,政府担心地缘竞争,小公司担心安全规则固化巨头优势。但 Amodei 的发声改变了讨论,因为它来自竞赛内部。他的核心判断是,安全工作需要时间、访问权限和可验证性;如果在关键能力门槛到来前多争取几个月或几年,并把时间用于监控、可解释性和隔离能力建设,结果可能完全不同。