AI 基础设施

Google Cloud Run instances 面向长期运行 AI 智能体,提供单实例 serverless 计算

Google Cloud 推出 Cloud Run instances 预览版,为长期运行的 AI 智能体和有状态负载提供托管单实例运行时。

发布于 更新于
Google CloudCloud RunAI 智能体

Google Cloud 推出 Cloud Run instances 预览版,面向个人 AI 智能体等长期运行、有状态负载。公司在 2026 年 8 月 27 日发布该功能,把它定位在两种常见但并不理想的选择之间:请求停止后会缩容到零的无状态 serverless 服务,以及需要持续管理并长期付费的专用虚拟机。

新产品瞄准的是 AI 智能体带来的真实基础设施缺口。传统 Cloud Run services 适合请求驱动的网站、API 和可横向扩展的任务。许多智能体的行为不同。OpenClaw 或 Hermes 这类工具可能为单个用户持续运行,监听事件,保存本地配置,等待消息,并在收到任务时短暂爆发计算。对于这种模式,缩容到零会中断助手,虚拟机又会带来系统维护、防火墙配置和不必要成本。

Cloud Run instances 在 Cloud Run 上提供专用单实例运行时。Google 表示,每个实例只运行一个副本,不自动扩缩容,可连续运行最长七天,默认配置自动重启策略,并获得一个在更新和重启后保持不变的 HTTPS URL。用户不需要时可以停止实例,需要时再恢复。这让开发者可以为持久化智能体提供托管运行环境,而不必运营完整虚拟机。

定价也是发布重点。Google 称,一个配置为 1 vCPU 和 1 GiB 内存的 Cloud Run instance 连续运行 30 天成本为 5.70 美元。该服务使用共享 vCPU 和 burst budget,适合长时间在线但不持续消耗重计算的智能体。许多个人或小团队智能体大部分时间都在等待输入、webhook 或消息,只有在执行任务时才短暂调用模型、工具或浏览器动作。

Google 的示例部署使用 OpenClaw,这是一个开源个人 AI 智能体,许多用户一开始会在笔记本上运行。笔记本方案的问题很明显:电脑睡眠后服务停止,出行时可用性下降,也很难作为消息工具的稳定端点。Cloud Run instances 允许开发者把智能体打包成容器,通过 Cloud Storage 挂载配置,并暴露稳定 URL。Google 还表示,Cloud Run instances 和 Cloud Run services 的 SSH 访问即将通过私有访问开放。

早期客户信号来自 OffDeal,这是一家面向小企业的 AI 投资银行。Google 称 OffDeal 把 Cloud Run instances 作为长期运行智能体的主要基础设施,并报告冷启动减少 88%。这是智能体开发者非常关注的指标。多步骤智能体可能在一个任务中发起数十次调用,即使模型本身很快,启动延迟也会累积成明显体验问题。

Cloud Run instances 表明 AI 智能体正在迫使云平台重新思考 serverless 假设。旧模型优化的是无状态请求处理和弹性规模;智能体负载更需要连续性、稳定身份、后台运行和对大部分空闲时间的成本控制。如果预览版成熟,它可能为个人助手、内部流程机器人和小型自主服务提供更清晰的部署路径。