AI 인프라

OpenAI, 10억 명 이상 ChatGPT 이용자를 지탱한 Habitat 확장 과정 공개

OpenAI가 온라인 스토리지 플랫폼 Habitat을 대규모 서비스로 발전시킨 과정을 설명했다.

게시일 업데이트
OpenAIChatGPTAI 인프라Habitat

OpenAI가 9월 11일 공개한 엔지니어링 글은 ChatGPT와 Codex, API 제품 뒤에서 작동하는 온라인 스토리지 플랫폼 Habitat의 성장 과정을 설명한다. 회사에 따르면 Habitat은 현재 초당 7천만 건이 넘는 요청을 처리하고, 매주 10억 명 이상이 사용하는 제품을 지원하며, 약 40개 지역에서 500PB가 넘는 데이터를 다룬다. 모델 성능 경쟁이 전면에 보이는 AI 산업에서 이 글은 실제 사용자 경험을 좌우하는 저장소, 권한, 라우팅, 지연 시간 관리가 얼마나 중요한지를 보여준다.

Habitat은 처음부터 거대한 분산 시스템은 아니었다. DevDay 2023 무렵 GPTs를 지원하기 위해 만들어진 Python 클라이언트 라이브러리로 출발했다. 제품 팀이 데이터 위치, 접근 권한, 데이터 거주 요건, 암호화, 직렬화, 연결 풀 같은 문제를 매번 직접 해결하지 않아도 되게 하는 것이 목표였다. 하지만 ChatGPT의 사용량이 폭발적으로 증가하고 OpenAI 내부 서비스가 늘어나자, 클라이언트 라이브러리에 복잡한 로직을 배포하는 방식은 취약해졌다. 작은 프로토콜 변경도 여러 팀과 서비스의 동시 업데이트를 요구했고, 지역 장애 대응 같은 핵심 작업도 느려졌다.

OpenAI는 결국 Habitat을 중앙 서비스로 분리했다. 이 구조는 라우팅, 권한 확인, 감사 로그, 속도 제한, 저장소 접근 제어를 한곳에서 시행하게 해준다. 동시에 Habitat은 임의의 복잡한 SQL 질의를 허용하지 않고 예측 가능한 객체와 관계 연산을 중심으로 설계됐다. 온라인 트래픽을 처리하는 핵심 저장소에서는 유연성보다 비용 예측 가능성이 더 중요할 때가 많다는 판단이다.

글은 Python으로 대규모 서비스를 운영한 비용도 다룬다. 라우팅, 압축, 암호화, 체크섬, 기능 플래그 파싱처럼 CPU를 많이 쓰는 작업은 asyncio 스케줄링 지연을 만들 수 있다. OpenAI는 설정 갱신 주기, 연결 재사용 방식, 프로세스당 동시성, Envoy 기반 연결 집약을 조정하며 병목을 줄였다. 이후 Rust 전환이 진행됐고, 2026년 2분기에 두 명의 엔지니어가 Codex와 GPT-5.5의 도움을 받아 서비스를 재작성했다. OpenAI는 Rust 버전이 현재 생산 요청의 95%를 처리하며 CPU 효율은 6배, 메모리 효율은 15배 높다고 밝혔다. AI 서비스의 규모 경쟁이 결국 깊은 시스템 엔지니어링 경쟁이 되고 있음을 보여주는 사례다.