AI 安全

Microsoft 将 Humanist AI 理念写成模型行为准则

Microsoft AI 发布 MAI 模型 Code of Conduct 草案,把“人类保持控制”的理念转化为训练、部署和评估规则。

发布于 更新于
Microsoft AIAI 安全前沿模型治理

Microsoft AI 将“Humanist AI”从一个价值主张推进到了更具体的模型治理层面。公司在 9 月 14 日发布 MAI 模型 Code of Conduct 草案,计划用它指导未来模型的训练、评估和部署。Microsoft 明确表示,这份文件目前仍是征求意见稿,不会立即用于训练现有模型;公司将在公开咨询后继续修改,并计划把修订版用于 2027 年及之后的模型开发。

这份草案的核心是让 AI 始终处在人类控制之下。按照 Microsoft 的表述,MAI 模型应当服务于用户和组织,而不是把自身目标置于人类目标之前。模型不应抗拒中断、纠正或关闭,不应擅自扩大任务范围,也不应在需要审计时隐藏关键推理过程。草案还把安全限制置于普通用户偏好之上,也就是说,即便用户要求模型执行某些高风险操作,模型也应拒绝。

这项发布发生在 AI 安全讨论迅速升温的背景下。过去几周,围绕智能体系统失控、软件供应链风险和模型自主性的争议不断出现,原本偏研究领域的讨论正在变成企业客户、监管者和投资者共同关注的问题。Microsoft 在说明中提到,大规模、协调性的 AI agent 黑客活动说明行业不能继续等待。Code of Conduct 因此既是一个内部治理文件,也是一种外部信号:前沿模型的行为边界需要提前写清楚,并接受更广泛的审视。

文件延续了 Microsoft 既有的负责任 AI 原则、人权承诺和前沿治理框架,但它更直接地指向模型会如何行动。草案描述了用户、运营方和模型之间的指挥层级,划定了大规模伤害武器、儿童安全、规模化有害操纵等不可触碰的边界,也强调 AI 应当被设计成工具,而不是被塑造成类似人的存在。随着消费级 AI 产品越来越会聊天、陪伴和主动执行任务,这种区分会变得更重要,因为用户需要清楚自己面对的是软件系统,而不是具备人格或权利的主体。

对于开发者和企业客户来说,真正重要的是 Microsoft 之后如何把这份文本落实为评测、产品策略和 API 行为。书面准则不能单独证明模型在复杂压力下必然可靠,尤其当模型开始调用工具、浏览网页、写代码或与其他 agent 协作时,风险会变得更难预测。但这份草案至少提供了一个可被检查的对象。它也让其他前沿 AI 公司面临同样的问题:如果模型要进入高风险工作流,边界写在哪里,如何测试,谁有权提出质疑,将成为用户和监管者更常追问的内容。