AI 인프라

Google Cloud Run instances, 장시간 실행 AI 에이전트를 위한 단일 서버리스 컴퓨트 제공

Google Cloud가 장시간 실행되는 AI 에이전트와 상태 저장 워크로드를 위한 관리형 단일 런타임 Cloud Run instances 프리뷰를 공개했다.

게시일 업데이트
Google CloudCloud RunAI 에이전트

Google Cloud가 개인 AI 에이전트 같은 장시간 실행 상태 저장 워크로드를 위해 Cloud Run instances 프리뷰를 공개했다. 회사는 2026년 8월 27일 이 기능을 발표하며 두 가지 흔하지만 불완전한 선택지 사이에 위치시켰다. 요청이 멈추면 0으로 축소되는 stateless serverless service와 지속 관리 및 상시 비용이 필요한 전용 가상머신이다.

새 제품은 AI 에이전트가 만든 실제 인프라 공백을 겨냥한다. 기존 Cloud Run services는 요청 기반 웹 애플리케이션, API, 수평 확장 가능한 작업에 적합하다. 그러나 많은 에이전트는 다르게 작동한다. OpenClaw나 Hermes 같은 도구는 한 명의 사용자를 위해 계속 실행되고, 이벤트를 감시하고, 로컬 설정을 기억하고, 메시지를 기다리다가 작업을 요청받으면 짧게 컴퓨팅을 사용한다. 이런 패턴에서는 0으로 스케일되는 구조가 보조자를 끊어 버리고, VM은 운영 부담과 불필요한 비용을 만든다.

Cloud Run instances는 Cloud Run 위에서 전용 singleton runtime을 제공한다. Google에 따르면 각 인스턴스는 하나의 복사본만 실행하며 autoscaling은 없다. 최대 7일 연속 실행할 수 있고 기본 자동 재시작 정책이 적용되며, 업데이트와 재시작 후에도 바뀌지 않는 HTTPS URL을 받는다. 필요 없을 때는 멈추고 다시 필요할 때 재개할 수 있다. 개발자는 전체 VM을 운영하지 않고도 지속적인 에이전트의 실행 장소를 만들 수 있다.

가격 예시도 핵심이다. Google은 1 vCPU와 1 GiB 메모리를 가진 Cloud Run instance를 30일 동안 계속 실행하면 5.70달러가 든다고 밝혔다. 서비스는 shared vCPU와 burst budget을 사용한다. 이는 오랫동안 살아 있지만 항상 무거운 계산을 하지 않는 에이전트에 맞다. 개인 또는 소규모 팀 에이전트는 대부분 입력, webhook, 메시지를 기다리다가 짧은 시간 동안 모델 호출, 도구 실행, 브라우저 작업을 수행한다.

Google의 예시는 오픈소스 개인 AI 에이전트 OpenClaw다. 많은 사용자는 처음 이런 에이전트를 노트북에서 실행한다. 하지만 노트북은 절전 모드에 들어가면 중단되고, 이동 중에는 가용성이 떨어지며, 메시징 도구를 위한 안정적인 엔드포인트가 되기 어렵다. Cloud Run instances를 쓰면 에이전트를 컨테이너로 패키징하고 Cloud Storage로 설정을 연결하며 일관된 URL을 노출할 수 있다. Google은 Cloud Run instances와 services를 위한 SSH 접근도 곧 제공될 예정이라고 밝혔다.

초기 고객 사례는 소기업을 위한 AI 기반 투자은행 OffDeal이다. Google은 OffDeal이 장시간 실행 에이전트의 주요 인프라로 Cloud Run instances를 사용하고 cold start를 88% 줄였다고 밝혔다. 이는 에이전트 개발자가 중요하게 보는 지표다. 다단계 에이전트는 하나의 작업 안에서 수십 번 호출할 수 있고, 시작 지연은 모델 자체가 빨라도 사용자 경험을 떨어뜨린다.

Cloud Run instances는 AI 에이전트가 클라우드 플랫폼의 serverless 가정을 바꾸고 있음을 보여준다. 예전 모델은 stateless 요청 처리와 탄력적 확장을 최적화했다. 에이전트 워크로드는 연속성, 안정적 정체성, 백그라운드 실행, 대부분 유휴 상태인 시간의 비용 통제를 요구한다. 프리뷰가 성숙하면 개인 비서, 내부 업무 봇, 작은 자율 서비스의 배포 경로가 더 간단해질 수 있다.