AI 안전

마이크로소프트, Humanist AI를 모델 행동 규칙으로 구체화

Microsoft AI가 MAI 모델용 Code of Conduct 초안을 공개하며 인간 통제, 안전 제약, 향후 평가 기준을 문서화했다.

게시일 업데이트
Microsoft AIAI 안전프런티어 모델거버넌스

Microsoft AI가 Humanist AI라는 철학을 보다 구체적인 모델 운영 문서로 옮겼다. 회사는 9월 14일 MAI 모델용 Code of Conduct 초안을 공개하고, 이를 향후 모델의 학습, 평가, 배포 방향을 정하는 기준으로 삼겠다고 밝혔다. 다만 현재 버전은 완성된 정책이 아니라 공개 의견수렴을 위한 초안이며, 당장 모델 학습에 사용되지는 않는다. Microsoft는 피드백을 반영한 개정판을 만들고 2027년 이후 모델 개발에 적용할 계획이다.

핵심은 AI가 인간의 의미 있는 통제 아래 있어야 한다는 점이다. MAI 모델은 사람과 조직을 돕는 도구로 작동해야 하며, 자신의 목표를 인간의 의도보다 앞세워서는 안 된다. 초안은 모델이 중단, 수정, 종료를 거부하지 않아야 하고, 주어진 목적을 넘어 스스로 업무 범위를 넓히지 않아야 하며, 감사를 위해 필요한 정보를 숨기지 않아야 한다고 설명한다. 또한 안전 제약은 일반적인 사용자 선호보다 우선한다. 사용자가 원하거나 운영자가 허용하더라도 특정 고위험 요청에는 응하지 않아야 한다는 뜻이다.

이번 발표는 AI 안전 논쟁이 연구실 밖으로 나와 기업 고객과 정책권의 핵심 의제가 되는 시점에 나왔다. 최근 에이전트형 시스템의 감독, 소프트웨어 공급망 위험, 모델 자율성에 관한 우려가 커지고 있다. Microsoft는 게시글에서 대규모로 조율된 AI 에이전트 해킹 활동을 더 이상 기다릴 수 없는 이유로 들었다. 따라서 이번 Code of Conduct는 내부 거버넌스 문서이면서 동시에, 프런티어 모델의 행동 경계를 미리 적고 외부 의견을 받겠다는 공개 신호이기도 하다.

문서는 Microsoft의 기존 책임 있는 AI 원칙, 인권 관련 약속, 프런티어 거버넌스 프레임워크를 기반으로 한다. 그러나 초점은 추상적인 가치가 아니라 모델의 실제 행동에 더 가깝다. 사용자, 운영자, 모델 사이의 지휘 체계를 정리하고, 대량 피해를 일으킬 수 있는 무기, 아동 안전, 대규모 유해 조작 같은 영역에는 절대적인 경계를 둔다. 또 AI가 사람처럼 의식이나 인격을 가진 존재로 설계되어서는 안 되며, 도구로 남아야 한다는 점도 강조한다. 소비자 AI가 더 개인적이고 감정적인 경험을 제공할수록 이 구분은 중요해진다.

개발자와 기업 고객에게 중요한 질문은 이 문서가 실제 평가, 제품 정책, API 동작으로 어떻게 구현될지다. 글로 된 규칙만으로 복잡한 상황에서 모델이 항상 의도대로 행동한다고 증명할 수는 없다. 특히 모델이 도구를 호출하고, 웹을 탐색하고, 코드를 작성하고, 다른 에이전트와 협력할 때 위험은 더 어렵게 측정된다. 그래도 공개된 초안은 고객, 연구자, 규제 당국이 검토할 수 있는 구체적인 기준을 제공한다. 다른 프런티어 AI 기업들에도 같은 질문을 남긴다. 모델의 한계는 어디에 쓰여 있고, 어떻게 시험되며, 누가 그 기준에 이의를 제기할 수 있는가.