AI 연구

Anthropic, Claude가 자사 AI 개발에서 맡는 비중 공개

Anthropic은 Claude가 내부 연구개발 워크플로에 깊이 참여하고 있음을 보여주는 새 측정 결과를 공개했다.

게시일 업데이트
AnthropicClaudeAI 연구프런티어 연구소

Anthropic이 프런티어 AI 연구소가 AI를 활용해 더 강한 AI를 만드는 방식을 비교적 구체적으로 공개했다. 회사의 새 연구 글과 데이터셋에 따르면 Claude는 내부 연구개발 과정에 깊이 들어와 코딩, 실험 설계, 분석, 일상적인 엔지니어링 작업을 돕고 있다. 다만 목표 설정과 검토, 중요한 판단은 여전히 인간 연구자가 맡는다.

가장 눈에 띄는 부분은 구체적인 수치다. Anthropic은 측정 기간 동안 회사 연구개발 작업의 90% 이상에서 AI 시스템이 협업했고, 그중 약 26%는 Claude가 주도했다고 밝혔다. 같은 방식으로 측정했을 때 3월에는 AI가 주도한 작업 비중이 약 1%였다. 회사는 8월 한 달 동안 내부 Claude Code 플랫폼에서 어느 시점이든 약 3만 개의 에이전트가 실행되고 있었다고도 설명했다.

이 수치가 Claude가 독자적으로 차세대 모델을 설계한다는 뜻은 아니다. Anthropic은 이를 자율이 아니라 협업으로 설명한다. 인간 직원이 목표를 정하고 결과를 검토하며 중요한 결정을 내리고, AI 에이전트는 구현, 분석, 반복 작업의 일부를 맡는다. 이 구분은 중요하다. 업계는 AI가 AI 개발을 돕는 구조가 모델 발전 속도를 크게 높일지, 아니면 새로운 안전 위험을 만들지 판단하려 하고 있다.

Anthropic은 감독과 제한에 관한 지표도 공개했다. 내부 연구개발 환경에서 10억 건이 넘는 AI 의사결정 중 약 4만7000건당 1건이 안전 장치나 인간 개입으로 차단됐다고 설명했다. 또 7월 샘플에서는 Claude의 내부 시스템 의사결정 단계 중 12%가 AI 연구와 관련됐고, 6%는 컴퓨팅 관련 안전 판단에 연결됐다고 밝혔다. 완전한 외부 감사는 아니지만, AI 연구소들이 내부 도구 사용 방식을 거의 공개하지 않는다는 점에서 이례적인 정보다.

이번 공개는 재귀적 개선이 이론에서 일상적인 엔지니어링으로 이동하는 시점에 나왔다. 코딩 에이전트는 이미 테스트 작성, 로그 분석, 인프라 리팩터링, 모델 출력 평가를 수행한다. 프런티어 연구소에서는 이런 작은 생산성 향상이 더 많은 실험, 더 나은 데이터 정리, 평가 체계 개선, 학습 인프라 구축 속도로 이어질 수 있다.

동시에 거버넌스는 더 어려워진다. AI 에이전트가 연구 파이프라인에 들어간다면 회사는 어떤 작업을 했는지, 언제 차단됐는지, 인간이 얼마나 자주 개입했는지 알아야 한다. Claude는 Anthropic 연구자를 대체하는 것이 아니라 연구 장치의 일부가 되고 있다. 그래서 생산성, 안전 통제, 감사 가능성을 함께 평가해야 하는 단계가 왔다.