AI 资讯

OpenAI 发布 GPT-5.6 Sol、Terra 与 Luna:功能和 API 定价

OpenAI 已在 ChatGPT、Codex 和 API 中推出 GPT-5.6 Sol、Terra 与 Luna,带来更强的编程、多智能体工作流、工具调用和三档价格。

发布于 更新于
OpenAI56AI

进入2026年7月10日,最值得关注的AI模型发布是OpenAI正式推出GPT-5.6。经过有限预览后,这个模型家族已经面向ChatGPT、Codex和OpenAI API开放,并通过三个能力和价格档位,让用户不必把所有任务都交给同一个旗舰模型。

这次升级的重点不只是更高的基准分数。OpenAI把GPT-5.6定位为面向端到端工作的模型,覆盖编程、设计、研究、计算机操作、工具协同和专业文档。对用户和开发者来说,真正需要回答的问题是:哪个档位能以合适的质量、速度和总成本完成自己的工作流。

OpenAI 发布了什么

GPT-5.6包含三个模型。GPT-5.6 Sol是旗舰档,面向高难度推理、编程、网络安全、科学研究和专业工作;GPT-5.6 Terra在能力与成本之间取得平衡,适合日常任务;GPT-5.6 Luna则是速度最快、价格最低的档位。

OpenAI表示,这一系列模型比GPT-5.5能从每个token中完成更多有效工作。Sol提升了计算机操作和设计判断能力,而Terra与Luna的目标,是让不需要最高档模型的工作也能获得更实用的智能体能力。

本次发布还加入了面向复杂任务的高强度模式。max会给模型更多时间探索方案并验证结果;ultra会协调多个智能体并行处理不同工作流,以更高的token消耗换取复杂任务上更强的结果和更短的完成时间。

新增的开发者能力

Programmatic Tool Calling(程序化工具调用)允许GPT-5.6编写并运行轻量程序,用来协调工具、筛选中间结果,并判断哪些信息需要返回模型。当智能体要检查大量记录、工具输出或文件时,这种方式可以减少重复的模型往返和上下文传输。

Responses API还增加了多智能体beta功能。开发者可以并发运行多个子智能体,再在一次请求中汇总结果。它适合编程代理、研究系统、财务分析、文档工作流,以及其他可以拆成独立任务并行执行的场景。

GPT-5.6 定价与可用性

GPT-5.6 Sol的价格为每百万输入token 5美元、每百万输出token 30美元。Terra为每百万输入token 2.50美元、输出token 15美元;Luna为每百万输入token 1美元、输出token 6美元。

GPT-5.6正在ChatGPT、Codex和OpenAI API中逐步开放。不同订阅方案获得的模型组合并不相同:ChatGPT付费用户可以使用Sol,而ChatGPT Work和Codex会根据套餐提供Sol、Terra、Luna、max和ultra的不同组合。

对开发者而言,标价只是成本计算的起点。如果一个模型能减少工具调用、降低返工次数,或用更少输出token完成任务,那么即使单价较高,实际总成本也可能更低。

用户应该怎样测试

  • 使用同一个真实任务比较Sol、Terra和Luna,不要只看模型基准。
  • 同时记录完成质量、延迟、输出token、工具调用次数和人工复核时间。
  • 将Sol用于复杂编程、研究、设计或错误代价较高的专业草稿。
  • 当质量可接受时,将摘要、提取、分类和简单编辑交给Terra或Luna。
  • 只在任务确实适合并行调查时使用ultra,不要把它设成所有提示词的默认模式。

开发者需要关注什么

开发者应关注Programmatic Tool Calling如何改变智能体架构。如果模型可以在轻量程序中处理工具输出,应用可能不再需要那么多编排循环和重复上下文。不过,对会产生实际后果的操作,团队仍应保留评估、成本上限、权限边界和人工审核。

提示缓存也会影响生产成本。GPT-5.6及后续模型的缓存读取继续享受较大折扣,但缓存写入会产生额外费用。使用长系统提示词或重复上下文的产品,应在估算成本前单独测试缓存行为。

搜索意图解析

搜索GPT-5.6发布消息的用户,通常想知道模型何时上线、Sol、Terra和Luna有什么区别、ChatGPT或Codex是否已经可用,以及API价格是多少。

搜索GPT-5.6与Claude或Gemini对比的用户,真正关心的是工作流:哪个模型能用更少的修改完成编程、研究、设计和智能体任务,并提供更好的性价比。这个问题需要用代表性的真实任务评估,而不是依赖单一基准。

Goodiebase 观点

GPT-5.6让模型选择变得更明确。Sol、Terra和Luna并不只是简单的高、中、低档,而是针对不同预算和工作负载的路由选择。

对Goodiebase用户来说,实用做法是按任务升级。先在质量和自主性能够明显减少复核时间的工作上测试最强档位,再把不需要最高推理强度的重复任务交给低成本模型。