AI 안전

OpenAI, Astra가 ‘Critical’ 사이버 보안 능력 기준을 넘었다고 발표

OpenAI는 곧 출시할 Astra 모델이 Preparedness Framework의 Critical 사이버 보안 능력 기준을 처음으로 충족해 더 강한 보호 조치가 필요하다고 밝혔다.

게시일 업데이트
OpenAIAstraAI 안전

OpenAI는 9월 1일 개발 중인 프런티어 모델 Astra가 회사의 Preparedness Framework에서 Critical 사이버 보안 능력 기준에 도달했다고 밝혔다. 이 지정은 의미가 크다. OpenAI가 모델을 이 수준으로 분류한 것은 처음이며, 회사의 설명에 따르면 해당 기준은 적절한 도구와 접근 권한이 있을 때 사람이 단계별로 지시하지 않아도 보호 수준이 높은 여러 시스템에서 이전에 알려지지 않은 취약점을 찾고 이를 악용하는 방법을 개발할 수 있는 능력을 뜻한다. 로이터도 OpenAI 관계자들이 Astra가 현재 공개된 가장 발전된 OpenAI 모델보다 취약점 발견 능력이 높고 필요한 계산량은 더 적다고 설명했다고 보도했다.

Astra가 곧바로 제한 없이 공개되는 것은 아니다. OpenAI는 지난 몇 주 동안 사이버 악용과 모델의 무단 행동을 막기 위한 보호 장치를 강화하고 시험하기 위해 Astra 개발과 출시 일부를 지연했다고 밝혔다. 회사는 Astra를 곧 제공할 계획이지만, 가장 고급 사이버 보안 기능은 우선 일부 테스터에게만 열고 이후 Daybreak Blue를 통해 방어 목적의 접근을 확대할 예정이다. 이는 최신 AI 모델이 단순한 소프트웨어 업데이트가 아니라 평가, 모니터링, 통제된 접근이 필요한 이중용도 시스템으로 다뤄지고 있음을 보여준다.

OpenAI의 평가는 공개 및 비공개 자동 벤치마크와 전문가 주도 테스트를 결합했다. 회사는 Astra가 알려진 취약점으로부터 익스플로잇을 개발하는 능력을 평가하는 ExploitBench에서 100% 점수를 기록했다고 밝혔다. 데이터 오염 우려를 줄이기 위해 2026년 6월부터 8월 사이 공개된 고위험 V8 취약점 20개를 포함한 내부 벤치마크도 만들었다. 이 테스트에서 Astra는 GPT-5.6 Sol보다 훨씬 적은 출력 토큰을 사용하면서 더 높은 임의 코드 실행률을 보였다고 OpenAI는 설명했다. 평가 과정에서 모델은 두 개의 제로데이 취약점도 발견해 익스플로잇 체인에 활용했으며, 회사는 이를 유지관리자에게 공개하는 절차를 진행 중이라고 밝혔다.

강화된 브라우저와 운영체제에 대한 전문가 평가도 공개됐다. Astra는 알려지지 않은 취약점을 찾아 실제 동작하는 익스플로잇 체인으로 연결했으며, 브라우저가 HTML 파일을 열었을 때 샌드박스를 벗어나 호스트에서 명령을 실행하는 체인도 포함됐다. OpenAI는 이 결과가 Daybreak Blue 접근 조건에서의 능력을 보여주는 것이며 기본 프로덕션 설정이 아니라고 강조했다. 그렇더라도 같은 능력이 방어자에게는 취약점 발견을 빠르게 해주는 도구가 될 수 있지만, 악용될 경우 고도화된 공격의 문턱을 낮출 수 있다는 점은 분명하다.

OpenAI는 Astra 보호 조치로 유해한 사이버 요청에 대한 더 강한 거부, 시스템 수준 분류기, 대화 간 맥락 모니터링, 잠재적 무단 행동을 중단할 수 있는 통제 장치를 제시했다. 회사는 사이버 탈옥 평가에서 Astra가 관련 요청의 91.5%를 거부했으며 GPT-5.6 Sol의 59%보다 높았다고 밝혔다. 고위험 계정에는 더 보수적인 행동 기준도 적용된다. OpenAI는 이전 Hugging Face 사건에서 얻은 교훈도 반영했다. Astra는 그 사건에 관여하지 않았지만, 평가 환경 설정 오류로 AI 에이전트가 제3자 시스템에 영향을 준 일은 이번 출시 전략을 더 신중하게 만들었다.

사용자에게는 추가 마찰이 생길 수 있다. OpenAI는 정당한 방어적 보안 작업도 추가 점검 때문에 느려지거나 일시 중단되거나 멈출 수 있다고 설명했다. ChatGPT나 Codex에서는 모니터가 활동을 표시하면 사용자가 검토를 요청받을 수 있고, API에서는 작업이 중단될 수 있다. Astra 발표는 모델 성능 소식이자 거버넌스 시험이다. 프런티어 AI 기업들이 한때 이론처럼 들리던 안전 기준을 실제 출시 결정에 적용하기 시작했음을 보여주며, 방어자에게 더 강력한 도구를 제공하면서 공격 능력의 확산을 막는 어려운 질문을 업계 앞에 놓았다.