AI 基础设施

OpenAI 公布 Jalapeño 推理芯片结果,自研硅片成为 AI 基础设施关键叙事

OpenAI 公布首款自研推理芯片 Jalapeño 的实测结果,称其在多个公开模型上实现更高每瓦性能和更低延迟。

发布于 更新于
OpenAIJalapeñoAI 推理

OpenAI 公布首款自研推理芯片 Jalapeño 的首批实测结果,使这项长期被关注的硬件计划从战略口号进入性能数据阶段。公司 8 月 25 日表示,Jalapeño 在 SemiAnalysis 的 InferenceX 基准中,相比对照系统展现出更好的吞吐、延迟和能效组合。对于正在被要求证明巨额算力投入能否形成可持续经济性的 AI 行业来说,这不是普通芯片更新,而是 OpenAI 明确表态:让模型更便宜、更快地运行,正在变得和训练更强模型一样重要。

Jalapeño 面向的是推理,也就是模型在真实产品中响应用户、驱动智能代理并逐个生成 token 的阶段。OpenAI 称,它用 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 进行测试,显示架构并不只服务自家模型。公司报告称,Jalapeño 在峰值吞吐下每瓦可完成的 AI 工作量提高 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍,在高度交互式负载中性能提升 2.1 至 4.1 倍。

每瓦性能之所以被放在核心位置,是因为生成式 AI 的成本结构正在变化。前沿实验室已经为训练集群投入大量资本,但推理成本会在产品每一次被使用时重复出现。智能代理进一步放大这种压力,因为它们不只回答一次,而是读取文件、调用工具、检查中间结果并多轮循环。每一步的小延迟和能耗都会在长任务中累积,最终影响用户体验和毛利率。

OpenAI 称 Jalapeño 从一开始就围绕这类负载设计,试图减少数据移动,把模型状态和生成时使用的 KV 缓存尽量放在接近计算与网络资源的位置。语言模型服务包含不同阶段:处理长提示更偏计算密集,逐 token 生成则常受内存带宽和通信延迟限制。一个真正有效的推理系统必须同时兼顾这些阶段,而不是只在单一指标上好看。

公司还把 Jalapeño 放进更大的全栈战略中。OpenAI 表示,早期模型帮助工程团队设计和 bring-up 芯片,新模型则参与优化和编程。公司称,在部分注意力和混合专家模块上,AI 生成的实现比原有人类专家代码快 1.5 至 1.8 倍,同时强调这只适用于选定模块而非完整模型。这意味着未来芯片可能不仅由 AI 辅助设计,也会由 AI 持续调优。

OpenAI 计划在年底前把 Jalapeño 部署到自有计算基础设施中,并继续推进量产资格验证和软件成熟度工作。第二代和第三代设计也已在推进。基准结论仍需要在真实客户流量下独立验证,但方向已经清楚。下一阶段 AI 基础设施竞争不只是看谁能训练最大模型,而是看谁能让越来越强的模型以足够快、足够高效、足够低成本的方式全天候运行。