Modelos de IA
OpenAI publica guia do GPT-5.6 enquanto a economia dos agentes muda para combinações de modelos mais baratas
A OpenAI afirma que o GPT-5.6 permite combinar seleção de modelos, raciocínio retido, orquestração multiagente e chamadas programáticas de ferramentas para reduzir custos de agentes em produção.
A OpenAI publicou um guia para desenvolvedores sobre o GPT-5.6 que apresenta a nova família de modelos menos como uma atualização única de topo e mais como um conjunto de escolhas de engenharia para agentes em produção. O guia de 13 de agosto afirma que startups podem obter bom desempenho combinando modelos, reduzindo o esforço de raciocínio quando possível, preservando raciocínio útil entre turnos e movendo o tratamento determinístico de dados para fora do contexto do modelo.
Segundo a OpenAI, o GPT-5.6 continua a trajetória iniciada com o GPT-5: lidar com tarefas mais longas usando menos tokens e com menos mudanças nos sistemas existentes. A empresa cita o Agents’ Last Exam, no qual o GPT-5.6 Sol com low reasoning superou o GPT-5.5 com high reasoning no mesmo harness. Isso sugere que nem toda tarefa séria precisa ir para a configuração mais cara.
A seleção de modelos é a parte mais concreta. A OpenAI diz que o GPT-5.6 Luna mantém 98% da precisão de extração do GPT-5.5 no fluxo de documentos da Hypha por um décimo oitavo do custo. A Browser Use relatou que Luna concluiu 78% de 106 tarefas difíceis de navegador por cerca de 14 dólares, enquanto um modelo de ponta chegou a 80% por cerca de 235 dólares.
A empresa combina essa economia com novos recursos da Responses API. Raciocínio retido e compactação nativa ajudam o modelo a manter trabalho útil em tarefas longas sem reconstruir o contexto. A orquestração multiagente nativa permite coordenar subagentes em paralelo. Chamadas programáticas de ferramentas deixam o GPT-5.6 escrever JavaScript para filtrar, agregar e coordenar resultados fora da janela de contexto.
O exemplo do ARC-AGI-3 mostra por que esses controles importam. A OpenAI diz que o GPT-5.6 Sol marcou 13,3% com um harness padrão, mas chegou a 38,3% com raciocínio retido e compactação, usando cerca de seis vezes menos tokens de saída. O resultado não se aplica automaticamente a todos os produtos, mas mostra que a forma como o agente organiza o trabalho pode alterar desempenho e custo.
O cache de prompts também recebeu uma atualização prática. A OpenAI afirma que o TTL mínimo de cache em toda a família passou para 30 minutos e que pontos de cache podem ser definidos de forma determinística dentro da janela de contexto. A Ploy relatou que pontos de cache e chaves por workspace em um prompt compartilhado de 29.000 tokens reduziram em 28% a entrada sem cache.
O significado mais amplo é que desenvolver agentes está virando uma disciplina de sistemas. Pesquisa jurídica, automação de navegador, análise financeira e fluxos de programação precisam decidir onde usar raciocínio de fronteira, onde usar modelos menores e quando dividir o trabalho. As equipes que melhor medirem qualidade, custo e confiabilidade terão mais chance de transformar a economia do GPT-5.6 em vantagem real.