Modelos de IA

OpenAI publica una guía de GPT-5.6 mientras la economía de los agentes gira hacia mezclas de modelos más baratas

OpenAI afirma que GPT-5.6 permite combinar selección de modelos, razonamiento retenido, orquestación multiagente y llamadas programáticas a herramientas para reducir el coste de los agentes en producción.

Publicado Actualizado
OpenAIGPT-5.6Agentes de IA

OpenAI ha publicado una guía para desarrolladores sobre GPT-5.6 que presenta la nueva familia de modelos no como una simple actualización insignia, sino como un conjunto de decisiones de ingeniería para agentes en producción. La guía del 13 de agosto sostiene que las startups pueden mejorar el rendimiento combinando modelos, reduciendo el esfuerzo de razonamiento cuando convenga, conservando razonamiento útil entre turnos y sacando del contexto del modelo el manejo determinista de datos.

Según la guía, GPT-5.6 continúa la trayectoria iniciada con GPT-5: resolver tareas de horizonte más largo con menos tokens y con menos fricción para los arneses existentes. OpenAI cita Agents’ Last Exam, donde GPT-5.6 Sol con low reasoning superó a GPT-5.5 con high reasoning usando el mismo arnés. La conclusión práctica es que no todas las tareas serias deben enviarse al ajuste más caro.

La selección de modelos es el punto más concreto. OpenAI dice que GPT-5.6 Luna conserva el 98% de la precisión de extracción de GPT-5.5 en un flujo de Hypha a una decimoctava parte del coste. Browser Use informó que Luna completó el 78% de 106 tareas difíciles de navegador por unos 14 dólares, mientras que un modelo de vanguardia llegó al 80% por unos 235 dólares.

OpenAI acompaña esa economía con nuevas funciones de Responses API. El razonamiento retenido y la compactación nativa ayudan a mantener trabajo útil en tareas largas sin reconstruir el contexto desde cero. La orquestación multiagente nativa permite que un agente principal coordine subagentes paralelos. Las llamadas programáticas a herramientas dejan que GPT-5.6 escriba JavaScript para coordinar, filtrar y agregar resultados fuera de la ventana de contexto.

El ejemplo de ARC-AGI-3 muestra por qué importan estos controles. OpenAI afirma que GPT-5.6 Sol obtuvo 13,3% con un arnés estándar, pero subió a 38,3% al activar razonamiento retenido y compactación, usando alrededor de seis veces menos tokens de salida. No implica que todas las aplicaciones verán el mismo salto, pero sí que la arquitectura del agente puede pesar tanto como el gasto en inferencia.

La caché de prompts también gana importancia. OpenAI dice que el TTL mínimo de caché en la familia de modelos se amplió a 30 minutos y que ahora se pueden fijar puntos de caché de forma determinista dentro del contexto. Ploy informó que al añadir esos puntos y claves específicas de espacio de trabajo a un prompt compartido de 29.000 tokens redujo la entrada no cacheada en un 28%.

El significado más amplio es que construir agentes se está convirtiendo en una disciplina de sistemas. Un producto de investigación legal, automatización web, análisis financiero o programación debe decidir qué pasos requieren razonamiento frontera, cuáles admiten modelos pequeños y cuándo dividir el trabajo entre subagentes. Los equipos con evaluaciones maduras estarán mejor preparados para capturar ahorro sin ocultar pérdidas pequeñas de precisión.