AI 基础设施
OpenAI 披露 Habitat 如何支撑十亿级 ChatGPT 用户
OpenAI 介绍了在线存储平台 Habitat 从 Python 客户端库成长为大规模服务层的过程。
OpenAI 发布了一篇工程文章,详细解释其在线存储平台 Habitat 如何支撑 ChatGPT、Codex 和 API 产品的增长。这篇 9 月 11 日的文章让外界少见地看到消费级 AI 服务背后的基础设施压力。OpenAI 称,Habitat 目前每秒处理超过 7000 万次请求,服务每周超过 10 亿用户使用的产品,并在接近 40 个地理区域管理超过 500PB 数据。
Habitat 最初并不是庞大的分布式系统。它在 2023 年 DevDay 前后作为 Python 客户端库出现,连接 OpenAI 的核心产品数据存储。这个库的目标是让产品团队不用反复处理相同的存储问题,例如数据应该从哪里读取、请求是否有权限、数据驻留规则如何执行,以及流量如何被限速。随着 ChatGPT 使用量扩大、产品团队增多,客户端库模式变得越来越难维护。任何协议变更都需要多个服务同时升级,区域容灾和路由调整也容易变得脆弱。
OpenAI 随后将 Habitat 抽成集中服务,把路由、授权、限流、审计日志和访问控制统一到一个位置执行。这种设计也让线上请求成本更可预测。Habitat 并不鼓励调用方对热数据存储发起任意复杂查询,而是提供受约束的对象和关系操作,尽量避免一个昂贵查询拖垮生产系统。
文章也坦率讨论了 Python 在这个规模下的代价。OpenAI 表示,选择 Python 服务是阶段性取舍,因为它能让团队快速稳定平台,但会带来延迟和计算成本。路由、压缩、加密、校验和配置解析等 CPU 密集任务,会让 asyncio 调度出现尾延迟。团队通过调整配置刷新、限制单进程并发、扩展工作进程数量来缓解问题。
最终,Habitat 正在迁移到 Rust。OpenAI 称,两名工程师在 2026 年第二季度借助 Codex 和 GPT-5.5 完成重写,新服务已承载 95% 生产请求,CPU 效率提升 6 倍,内存效率提升 15 倍。这条新闻说明,AI 产品竞争并不只发生在模型层面,真正决定体验的还有底层存储、连接池、调度与工程治理。