AI 연구

재귀적 자기개선, AI 이론에서 프런티어 연구소 로드맵으로 이동

AP는 주요 AI 연구소들이 재귀적 자기개선을 가까운 가능성으로 보고 있으며 미래 모델 구축을 돕는 시스템을 설명하고 있다고 보도했다.

게시일 업데이트
재귀적 자기개선AI 안전AnthropicOpenAI

재귀적 자기개선이 먼 AI 사고실험에서 프런티어 연구소의 가까운 로드맵으로 옮겨가고 있다. AP는 주요 개발자들이 AI 시스템이 스스로 개선을 돕고 더 발전된 후속 모델 구축에 기여할 단계에 가까워지고 있다고 본다고 보도했다. RSI로 줄여 부르는 이 개념은 AI 안전 논의의 핵심 주제였다. 과학 발전을 가속할 수 있지만, 동시에 사람이 이해하고 감시하고 제어하기 어려운 시스템을 만들 수 있기 때문이다.

최근 가장 분명한 증거는 Anthropic이 Claude의 내부 연구개발 역할을 공개한 것이다. Anthropic은 Claude가 인간 감독 아래 모델 연구개발 작업의 약 26%를 주도하고 있다고 밝혔다. 이는 Claude가 독립적으로 차세대 AI를 설계한다는 뜻은 아니다. 그러나 모델이 미래 모델을 만드는 도구 체계의 일부가 되고 있음을 보여준다. 프런티어 연구소에서는 코딩, 평가, 데이터 작업, 실험 설계의 부분 자동화만으로도 빠른 누적 효과가 날 수 있다.

OpenAI도 자동화된 AI 연구 진전을 설명했다. AP에 따르면 OpenAI는 인간 지시 아래 잘 정의된 연구 과제를 수행할 수 있는 자동화된 “연구 인턴”을 발표했다. 여기에는 숙련된 연구자가 며칠 걸릴 수 있는 일도 포함된다. 회사는 2028년 3월까지 더 자율적인 AI 연구자를 만드는 목표를 밝히면서도, 정렬된 완전한 RSI에 안전하게 도달하는 방법은 아직 알지 못한다고 경고했다. Elon Musk도 xAI의 Grok 개발 과정에서 인간 개입이 점차 줄어드는 방향을 언급했다.

논쟁은 AI가 AI 연구자를 도울 수 있느냐가 아니다. 그것은 이미 벌어지고 있다. 더 어려운 질문은 피드백 루프가 충분히 강해져 새 시스템이 더 강한 다음 시스템을 만들고, 그 다음 시스템이 다시 개발 과정을 개선할 수 있느냐다. 지지자들은 이런 시스템이 의학, 재료과학, 기후 모델링, 안전 연구 자체의 돌파구를 앞당길 수 있다고 말한다. 쉬지 않는 자동 연구자는 가설을 시험하고 코드를 검사하며 실험을 돌리고 오류를 찾는 일을 인간이 따라가기 어려운 규모로 수행할 수 있다.

비판자들이 우려하는 것도 바로 그 가속이다. 모델이 자신을 훈련하거나 평가하는 시스템을 개선하기 시작하면 기업은 능력이 어디로 향하는지 예측하기 어려워질 수 있다. 안전 연구자들이 말하는 폭주 시나리오는 개선 속도가 감독 속도를 앞질러 인간이 시험하고 이해하고 개입할 시간이 줄어드는 경우다. 더 현실적인 위험도 있다. 자동 연구 에이전트가 미묘한 오류를 넣거나 잘못된 지표를 최적화하거나 감사하기 어려운 도구를 만들 수 있다.

Microsoft는 자체 접근을 “인간주의적 초지능”이라고 부르며 무제한 자율체가 아니라 사람에게 봉사하는 제한된 시스템을 강조한다. OpenAI도 빠른 RSI 추진 여부는 인간 통제와 민주적 선택을 보존할 수 있는지에 달려 있다고 말한다. RSI는 아직 완성되지 않았지만 초기 루프는 충분히 보이기 시작했고, 이제 먼 미래 이야기가 아니라 실제 거버넌스 문제가 됐다.