AI 基础设施
NVIDIA Groq 3 LPX 进入量产,AI 智能代理推理不再只靠 GPU
NVIDIA 宣布 Groq 3 LPX 进入全面生产,用于扩展 Vera Rubin 系统,为长上下文和智能代理工作负载提供更快 token 生成能力。
NVIDIA 宣布 Groq 3 LPX 进入全面生产,并借 Hot Chips 大会把推理能力塑造成下一阶段 AI 工厂的核心瓶颈。公司 8 月 24 日表示,这款交互式推理加速器将扩展 Vera Rubin NVL72 平台,大幅提高面向智能代理系统的 token 生成速度。NVIDIA 的核心信息是,AI 基础设施下一阶段不只比谁能训练更大的模型,也要比部署后的模型能否在长上下文中快速阅读、推理、行动并保持用户可接受的响应速度。
Groq 3 LPX 针对的是现代推理中的一个具体痛点。AI 智能代理在执行任务时往往要经历数百甚至上千个步骤,包括读取文件、调用工具、检查结果、写代码、修改计划并再次迭代。每一步都会消耗大量 token,尤其在模型需要维持长上下文窗口时更明显。GPU 仍然适合许多计算环节,但 NVIDIA 认为,在响应速度和每 token 成本成为商业瓶颈时,生成阶段需要专门加速。
NVIDIA 引用的基准结果显示,Groq 3 LPX 在运行开源 Gemma 4 31B 模型、使用 10 万 token 上下文时,输出速度约为每秒 3400 个 token,公司称这是该模型已记录的最快表现。它还声称该系统在延迟敏感负载中的响应速度约为最接近替代平台的四倍。供应商基准仍需现实环境验证,但这些数字说明推理已经从训练之外分离成一个独立的系统设计问题。
这款产品也展示了 NVIDIA 在授权 Groq 推理技术并吸收相关人才之后的策略。Groq 3 LPX 并不是要直接取代 GPU,而是与 Vera Rubin 机架协同工作。其架构体现了推理分解的趋势:长上下文处理、token 生成、网络与存储分别由更适合的组件承担,再被设计成一个整体系统。对大型 AI 云和企业客户来说,这种协同可能比单点芯片性能更重要。
Nebius 是 NVIDIA 点名的首个 AI 云采用方,计划将 Groq 3 LPX 引入其 Token Factory 推理平台。基于相关技术的推理云公司 Groq 也被列为早期采用者之一。云端可用性决定了芯片发布能否被开发者实际感知。如果企业能够通过熟悉 API 获得更快的智能代理推理能力,最先受益的可能是代码代理、研究助手、客户支持自动化和多步骤办公工具。
这一发布发生在 AI 投资被更严格审视的阶段。企业已经把大量资本投入训练集群和数据中心,但真正长期运行的往往是部署后的推理工作负载。用户每一次提问、代理每一次行动都会产生成本。更低延迟和更低 token 成本因此不只是工程指标,也直接关系商业模式。Groq 3 LPX 的量产表明,AI 硬件竞争正在从“训练更大模型”转向“让智能系统足够快、足够便宜地持续运行”。