Infrastructure IA

Google Cloud Run instances vise les agents IA persistants avec un calcul serverless singleton

Google Cloud présente Cloud Run instances en preview, un runtime singleton géré pour agents IA persistants et charges avec état.

Publié Mis à jour
Google CloudCloud RunAgents IA

Google Cloud a présenté Cloud Run instances, une offre en preview conçue pour les charges longues et avec état, comme les agents IA personnels. L’entreprise a annoncé la fonction le 27 août 2026 en la plaçant entre deux options courantes mais imparfaites: des services serverless sans état qui descendent à zéro quand les requêtes cessent, et des machines virtuelles dédiées qui exigent gestion continue et dépenses de calcul permanentes.

Le produit vise une lacune d’infrastructure créée par les agents IA. Les Cloud Run services traditionnels conviennent aux applications web, API et tâches déclenchées par requête qui peuvent s’étendre horizontalement. Beaucoup d’agents fonctionnent autrement. Des outils comme OpenClaw ou Hermes peuvent tourner en continu pour un seul utilisateur, surveiller des événements, conserver une configuration locale, attendre des messages puis consommer brièvement plus de ressources lorsqu’une tâche arrive. Dans ce cas, le scale-to-zero interrompt l’assistant, tandis qu’une VM ajoute maintenance, pare-feu et coût inutile.

Cloud Run instances fournit un runtime singleton dédié sur Cloud Run. Google indique que chaque instance exécute une seule copie sans autoscaling, peut fonctionner jusqu’à sept jours en continu avec redémarrage automatique par défaut, reçoit une URL HTTPS stable après mises à jour et redémarrages, et peut être arrêtée puis reprise selon les besoins. Les développeurs obtiennent ainsi un domicile géré pour un agent persistant sans exploiter une VM complète.

L’exemple de prix est aussi central. Google affirme qu’une instance avec 1 vCPU et 1 GiB de mémoire exécutée en continu pendant 30 jours coûte 5,70 dollars. Le service utilise une vCPU partagée avec des budgets de burst, ce qui correspond aux agents actifs longtemps mais rarement gourmands en calcul. Beaucoup d’agents personnels ou d’équipes passent l’essentiel du temps à attendre entrées, webhooks ou messages avant de lancer de courts appels à des modèles, outils ou actions de navigateur.

L’exemple de déploiement utilise OpenClaw, un agent IA personnel open source que de nombreux utilisateurs commencent par exécuter sur leur ordinateur portable. Le problème est évident: il s’arrête quand la machine se met en veille, perd en disponibilité en déplacement et n’offre pas facilement un endpoint stable pour les outils de messagerie. Cloud Run instances permet de le placer dans un conteneur, d’attacher sa configuration via Cloud Storage et d’exposer une URL constante. Google indique aussi qu’un accès SSH arrivera prochainement par accès privé.

Le premier signal client vient d’OffDeal, une banque d’investissement propulsée par l’IA pour petites entreprises. Google dit qu’OffDeal utilise Cloud Run instances comme infrastructure principale pour un agent longue durée et a constaté une baisse de 88% des cold starts. C’est une métrique que les développeurs d’agents suivent de près. Un agent en plusieurs étapes peut déclencher des dizaines d’appels dans une tâche, et les retards de démarrage s’accumulent même avec un modèle rapide.

Cloud Run instances montre que les agents IA obligent les plateformes cloud à repenser le serverless. L’ancien modèle optimisait le traitement sans état et l’élasticité. Les charges agentiques ont besoin de continuité, d’identité stable, d’exécution en arrière-plan et de coûts maîtrisés pendant les temps majoritairement inactifs. Si la preview mûrit, elle pourrait simplifier le déploiement d’assistants personnels, de bots internes et de petits services autonomes.