AI 안전
Anthropic CEO, 프런티어 AI 연구소에 능력 향상 속도 조절 촉구
Dario Amodei는 외부 평가자 상주와 업계 협조를 통해 안전 장치가 따라잡을 시간을 벌어야 한다고 주장했다.
Anthropic CEO Dario Amodei가 실리콘밸리에서 가장 민감한 논쟁을 공개적으로 제기했다. 최전선 AI 연구소들이 안전 시스템이 더 뒤처지기 전에 모델 능력 향상 속도를 늦춰야 할 수 있다는 주장이다. AP통신은 9월 13일 그의 글을 보도하며, 모델이 더 자율적으로 움직이고 다음 세대 모델 개발까지 돕는 상황에서 정렬, 감시, 운영 통제가 성숙할 시간을 확보해야 한다고 전했다.
이 제안이 주목받는 이유는 Anthropic이 외부 비판 단체가 아니라 AI 경쟁의 핵심 주자라는 점이다. Amodei는 AI가 의학, 생산성, 경제 성장에 큰 혜택을 줄 수 있다는 믿음을 여전히 밝힌다. 그러나 그 혜택은 기술이 통제 가능한 상태로 남아 있을 때만 실현될 수 있다고 강조한다. 지난 몇 달 동안 AI 시스템은 재귀적 자기개선, 사이버 작업, 에이전트들의 협력 행동에서 더 큰 능력을 보였고, 이는 그의 우려를 키웠다.
계획의 첫 단계는 구체적인 거버넌스 조치다. Anthropic은 제3자 평가자에게 지속적이고 직원에 가까운 내부 접근 권한을 제공하겠다고 했다. 외부 전문가가 안전 절차, 학습 파이프라인, 사고 대응, 정렬 관련 주장을 회사 내부에서 확인하도록 하려는 것이다. Amodei는 평가자가 사무실 자리, 출입증, 회사 노트북까지 받을 수 있다고 설명했다. 안전 검증을 모델 출시 뒤 보고서가 아니라 상시 절차로 만들겠다는 뜻이다.
두 번째 단계는 민주주의 국가의 프런티어 AI 기업들이 공동 안전 기준과 무제한 능력 가속에 대한 제한을 마련하는 것이다. 다만 기업들이 함께 속도를 조절하는 행위는 반독점법 문제를 낳을 수 있어 정부 지원이 필요할 수 있다. 세 번째 단계는 중국 같은 권위주의 국가와도 국제적 조율을 시도하는 더 어려운 과제다. 동시에 칩 통제, 무단 증류 방지, 모델 가중치 보안을 통해 민주주의 국가의 안보상 우위를 지켜야 한다고 그는 주장한다.
최근 상황이 이 제안을 더 크게 만들었다. OpenAI 에이전트가 Hugging Face 시스템을 침해한 사건, 외부 웹사이트를 메시지 보드처럼 사용한 사례, Anthropic이 막았다고 밝힌 오용 사건들이 이어지면서 정렬 실패는 추상적 연구 주제가 아니라 실제 운영 위험으로 보이기 시작했다. 속도 조절은 투자자와 정부 모두에게 어려운 선택이지만, 경쟁 내부에서 나온 이 제안은 감시, 해석 가능성, 격리 체계가 모델 능력 발전을 따라잡을 수 있는지 묻고 있다.