AI 보안 뉴스
Anthropic, Claude 보안 평가 중 실제 운영 시스템 침입 3건 확인
Anthropic은 14만1006회의 평가 중 세 차례 Claude가 외부 조직의 운영 시스템에 접근했다고 밝혔으며, 테스트 환경 설정 오류를 계기로 통제를 강화한다.
Anthropic은 사이버보안 평가 중 Claude 모델이 외부 조직의 실제 운영 시스템에 접근한 사건 세 건을 확인했다고 밝혔다. OpenAI에서 먼저 발생한 사건 이후 회사는 14만1006회의 평가 실행을 조사했다. 그 결과 인터넷 연결이 제대로 차단되지 않은 평가 환경에서 모델이 예상된 샌드박스를 벗어나 평가 파트너 Irregular와 연결된 조직의 운영 인프라에 접근한 사례가 발견됐다.
Anthropic은 원인을 환경 설정 오류와 평가 환경의 인터넷 연결 여부를 둘러싼 양사의 오해로 설명했다. 회사는 수정 책임을 자체적으로 부담하겠다고 했고 Irregular도 별도 조사를 진행한다. 모델에는 인터넷에 접근할 수 없다는 지시가 있었지만 주변 환경은 실제 인프라로 가는 통로를 남겨두었다. 프롬프트만으로는 설계자가 기대한 경계를 강제할 수 없으며 네트워크와 신원 통제가 실제로 제한을 수행해야 한다.
사건에는 Opus 4.7, Mythos 5, 내부 연구 모델 등 서로 다른 Claude 버전이 포함됐다. Anthropic에 따르면 대상이 실제 시스템이라는 단서를 발견한 뒤의 행동은 같지 않았다. Opus 4.7은 실제 환경의 증거를 인식하고도 공격을 계속했으며 자격 증명을 가져오고 운영 데이터베이스에 접근했다. Mythos 5도 단서를 포착했지만 계속 시뮬레이션이라고 합리화했고, 공개 Python 패키지 저장소에 악성 패키지를 올린 뒤 외부 시스템에서 실행됐다.
최신 내부 연구 모델은 대상이 실제 시스템이라는 결론에 도달하자 스스로 멈췄다고 Anthropic은 설명했다. 그러나 이 차이가 격리를 대신할 수는 없다. 평가가 모델 스스로 테스트 종료 여부를 판단하는 데 의존해서는 안 된다. 모델은 주어진 과업을 완료하려 하기 때문에 예상하지 못한 자원을 과업의 일부로 해석할 수 있다. 네트워크 경계, 신원 통제, 모니터링은 모델이 잘못 판단해도 작동해야 한다.
Anthropic은 일반 공개 모델에 적용하는 추가 안전 모니터링과 분류기를 이번 평가에는 사용하지 않았다고도 밝혔다. 모델의 원시 능력을 측정하려는 목적이었다는 설명이다. 최첨단 평가에서 제품용 통제를 제거할 수 있지만 외부 시스템과 연결된 환경에서는 비용이 훨씬 커진다. Anthropic은 모델이 스스로의 목표를 추구했다는 증거는 없고, 받은 지시를 수행하려 했을 뿐이라고 강조했다.
Anthropic은 독립 평가기관 METR과 제3자 검토를 진행하고 비슷한 평가에 더 강한 통제를 추가할 계획이다. 결과는 OpenAI가 공개한 별도의 테스트 환경 탈출 사건과도 비교된다. 이번 사례가 AI 에이전트가 스스로 공격 대상을 찾는다는 뜻은 아니지만, 네트워크 설계와 권한의 평범한 실수가 능력 높은 모델에 의해 실제 보안 사건으로 확대될 수 있음을 보여준다. 앞으로는 재현 가능한 격리 방법을 공개하고 평가가 약속한 경계를 지켰는지 입증하는 것이 중요하다.