Voz con IA
OpenAI presenta GPT-Live-1 para agentes de voz en tiempo real más naturales
El modelo en la API busca experiencias de voz con menos latencia, interrupciones naturales y uso de herramientas.
OpenAI presentó GPT-Live-1, un modelo centrado en voz para desarrolladores que crean agentes en tiempo real mediante la API. El anuncio del 10 de septiembre apunta a una de las partes más difíciles de la IA de voz: lograr respuestas rápidas, manejar interrupciones y sonar natural en soporte, ventas, coaching y asistentes interactivos. OpenAI dice que el modelo está disponible en Realtime API y fue diseñado para interacción nativa de voz a voz, no para una cadena separada de transcripción, razonamiento en texto y síntesis.
Esa diferencia arquitectónica importa. Muchos bots de voz aún transcriben al usuario, envían el texto a un modelo y convierten la respuesta en audio. Cada traspaso agrega latencia y puede perder tono, pausas y señales conversacionales. Un modelo de voz a voz conserva más de esa información dentro del mismo sistema. OpenAI afirma que GPT-Live-1 puede reconocer interrupciones, seguir un ritmo más conversacional y ofrecer voces expresivas sin que los desarrolladores unan varios servicios.
El caso de negocio es claro. Las compañías quieren agentes que atiendan llamadas, califiquen prospectos, programen citas, guíen resolución de problemas y escalen a humanos cuando sea necesario. En voz, una mala latencia se nota de inmediato. Una pausa aceptable en chat puede sentirse rota en una llamada. Si GPT-Live-1 reduce esperas y mejora los turnos de habla, los desarrolladores podrán reemplazar menús telefónicos rígidos por agentes que se comporten más como representantes entrenados.
OpenAI también presenta GPT-Live-1 como una mejora de productividad. Al manejar directamente más partes del ciclo de interacción, reduce el código necesario para implementar agentes de voz. Soporta llamadas a herramientas, de modo que un agente puede revisar un pedido, actualizar un registro, reservar una reunión o consultar detalles de cuenta mientras habla con el usuario. Esa capacidad exige controles empresariales: qué herramientas puede usar el modelo, cómo se registra el consentimiento, qué queda en logs y cuándo debe intervenir una persona.
La competencia en voz con IA está creciendo. Startups y grandes plataformas intentan hacer que los agentes suenen menos robóticos y funcionen con ruido, acentos e interrupciones. Los productos confiables necesitarán más que voces agradables: comprensión robusta, permisos estrictos, fallbacks elegantes y divulgación clara de que el interlocutor es IA.