AI 模型

OpenAI 发布 GPT-5.6 构建者指南,智能体成本转向更灵活的模型组合

OpenAI 表示,GPT-5.6 可通过模型选择、保留推理、多智能体编排和程序化工具调用,降低生产级智能体成本。

发布于 更新于
OpenAIGPT-5.6AI 智能体

OpenAI 发布了一份面向开发者的 GPT-5.6 指南。与单纯强调旗舰模型升级不同,这份 8 月 13 日发布的指南把 GPT-5.6 描述为一组用于生产级智能体的工程选择:何时使用更强模型,何时降低推理强度,何时保留跨轮次推理,以及何时把确定性数据处理移出模型上下文。

指南延续了 GPT-5 以来的方向:用更少 token 处理更长周期的任务,并尽量减少开发者对现有评测框架的改造。OpenAI 称,在 Agents’ Last Exam 中,GPT-5.6 Sol 使用 low reasoning 时,在相同框架下超过了 GPT-5.5 的 high reasoning 表现,这意味着开发者不一定总要把严肃任务交给最昂贵配置。

模型选择是最具商业意义的部分。OpenAI 称,GPT-5.6 Luna 在 Hypha 的文档理解流程中,以十八分之一成本保留了 GPT-5.5 提取准确率的 98%。Browser Use 报告称,Luna 以约 14 美元完成 106 个困难浏览器任务中的 78%,而当前最强模型以约 235 美元达到 80%。

OpenAI 同时强调 Responses API 的新能力。保留推理和原生压缩用于让模型在长任务中保留有用工作,而不是反复重建上下文。原生多智能体编排可让主智能体协调并行子智能体。程序化工具调用则让 GPT-5.6 编写 JavaScript,在上下文窗口外过滤、聚合和协调工具结果。

ARC-AGI-3 的例子展示了架构变化的影响。OpenAI 称,GPT-5.6 Sol 在标准框架下得分为 13.3%,启用保留推理和压缩后升至 38.3%,同时输出 token 约减少六倍。这并不代表所有应用都会获得同样收益,但说明智能体管理工作方式本身可能带来明显提升。

提示缓存也被强化。OpenAI 表示,整个模型家族的最小缓存有效期扩展至 30 分钟,并且可以在上下文窗口中确定性设置缓存断点。Ploy 报告称,在 29,000 token 的共享提示中加入缓存断点和工作区密钥后,未缓存输入减少了 28%。

这份指南的行业含义是,智能体开发正在变成系统工程。法律研究、浏览器自动化、金融分析和编码工作流都需要决定哪些步骤值得使用前沿推理,哪些步骤适合较小模型,以及如何复用上下文。真正受益的团队将是那些能持续衡量质量、成本和可靠性的团队。