AI 基础设施
OpenAI 预览由 Cerebras 驱动的 GPT-5.6 Sol Ultrafast 模式
OpenAI 表示,限量预览的 Ultrafast 模式可让 GPT-5.6 Sol 比标准处理快最高 14 倍,并达到每秒 750 个输出 token。
OpenAI 预览了 Ultrafast,这是一个面向低延迟场景的新服务层。根据 8 月 13 日公告,Ultrafast 可让 GPT-5.6 Sol 的运行速度最高达到 Standard processing 的 14 倍,并可生成每秒最高 750 个输出 token。该服务首先以限量预览形式进入 OpenAI API,并由 Cerebras 提供超低延迟推理能力。
这个产品重要,是因为它试图削弱 AI 应用长期面对的取舍。语音助手、实时客服、监控系统和交互式研究产品通常会为了速度选择较小模型,即便更强模型能给出更好的结果。OpenAI 的主张是,GPT-5.6 Sol 在 Ultrafast 上可以把前沿智能带入更强调时间的工作流。
OpenAI 列举了多个早期场景。事故响应中,更快的前沿模型可以在故障仍在发生时读取日志、代码变更和工程师报告,帮助定位原因并准备修复建议。金融研究和安全场景中,它可以在信号和交易仍在变化时分析可疑行为。客服和语音场景中,它可以在对话不中断的情况下完成多步骤查询。
OpenAI 也在内部测试该服务。公告称,工程团队用 GPT-5.6 Sol Ultrafast 阅读 traces、整理沟通记录并缩小下一步排查范围。研究团队则用它更快搜索知识源、查询数据和组织信息,把一些过去依赖夜间批处理的流程压缩成工作日内多轮迭代。
早期客户反馈显示 OpenAI 关注的是生产环境。Jane Street 认为 Cerebras 带来的速度提升让开发者更容易保持专注。Podium 表示,Ultrafast 改变了复杂语音工作的通话体验。Basis 强调,以前同步体验常受限于模型智能,而 Ultrafast 同时提供速度和能力。Rogo 则认为复杂金融研究更接近实时互动。
Cerebras 合作让这次发布具有基础设施意义。模型提供商竞争的不只是能力,推理速度和成本也会影响商业落地。一个强但慢的模型适合隔夜研究,却未必适合结账助手、实时分析师、客服电话或工程事故。OpenAI 正在把延迟变成可购买的产品维度。
限量预览意味着这些说法仍需在更广泛客户中验证。每秒 token 数并不自动等于完整工作流速度,因为工具调用、检索、网络延迟和人工审核仍可能占用大量时间。容量扩张也会影响体验。即便如此,Ultrafast 显示高端 AI 服务正在从“答案更好”走向“答案快到足以改变现场决策”。