Infraestructura de IA
Google Cloud Run instances apunta a agentes de IA persistentes con cómputo serverless singleton
Google Cloud presentó Cloud Run instances en preview, un runtime singleton gestionado para agentes de IA persistentes y otras cargas con estado.
Google Cloud presentó Cloud Run instances, una oferta en preview diseñada para cargas persistentes y con estado como agentes personales de IA. La compañía anunció la función el 27 de agosto de 2026 y la ubicó entre dos opciones comunes pero imperfectas: servicios serverless sin estado que escalan a cero cuando no hay solicitudes y máquinas virtuales dedicadas que exigen gestión continua y gasto permanente.
El producto apunta a una brecha de infraestructura creada por los agentes de IA. Los Cloud Run services tradicionales funcionan bien para aplicaciones web, APIs y tareas impulsadas por solicitudes que pueden escalar horizontalmente. Muchos agentes se comportan de otra forma. Herramientas como OpenClaw o Hermes pueden ejecutarse continuamente para un solo usuario, monitorear eventos, recordar configuración local, esperar mensajes y aumentar brevemente el uso cuando reciben una tarea. En ese patrón, escalar a cero interrumpe al asistente, mientras una VM añade mantenimiento, firewall y costo innecesario.
Cloud Run instances ofrece un runtime singleton dedicado sobre Cloud Run. Google dice que cada instancia ejecuta una sola copia, sin autoscaling; puede correr hasta siete días continuos con política de reinicio automático por defecto; recibe una URL HTTPS estable que no cambia con actualizaciones o reinicios; y puede detenerse cuando no se usa y reanudarse después. Eso da a los desarrolladores un hogar gestionado para agentes persistentes sin operar una VM completa.
El ejemplo de precio es central. Google afirma que una instancia con 1 vCPU y 1 GiB de memoria ejecutándose 30 días seguidos cuesta 5,70 dólares. El servicio usa vCPU compartida con presupuestos de burst, lo que encaja con agentes que están vivos mucho tiempo pero no consumen cómputo pesado constantemente. Muchos agentes personales o de equipos pequeños pasan la mayor parte del tiempo esperando entradas, webhooks o mensajes, y luego realizan ráfagas cortas de llamadas a modelos, herramientas o acciones de navegador.
El despliegue de ejemplo usa OpenClaw, un agente personal de IA open source que muchos usuarios empiezan ejecutando en sus portátiles. El problema es evidente: el agente se detiene cuando la máquina duerme, pierde disponibilidad cuando el usuario viaja y no ofrece fácilmente un endpoint estable para herramientas de mensajería. Cloud Run instances permite empaquetarlo como contenedor, adjuntar configuración mediante Cloud Storage y exponer una URL consistente. Google también dijo que el acceso SSH para Cloud Run instances y services llegará pronto mediante acceso privado.
La señal inicial de cliente proviene de OffDeal, un banco de inversión impulsado por IA para pequeñas empresas. Google dice que OffDeal usa Cloud Run instances como infraestructura principal para un agente de larga ejecución y reportó una reducción de 88% en cold starts. Es una métrica importante para constructores de agentes. Los agentes de varios pasos pueden hacer docenas de llamadas dentro de una tarea, y los retrasos de arranque se acumulan aunque el modelo sea rápido.
Cloud Run instances muestra que los agentes de IA están obligando a las plataformas cloud a repensar supuestos serverless. El modelo anterior optimizaba procesamiento sin estado y escala elástica. Las cargas agentic necesitan continuidad, identidad estable, operación en segundo plano y costo controlado para tiempos mayormente inactivos. Si el preview madura, puede ofrecer un camino más limpio para asistentes personales, bots internos y pequeños servicios autónomos.