Voix IA
OpenAI présente GPT-Live-1 pour des agents vocaux en temps réel plus naturels
Le modèle API vise une voix à faible latence, capable de gérer les interruptions et d’appeler des outils.
OpenAI a présenté GPT-Live-1, un modèle centré sur la voix pour les développeurs qui créent des agents vocaux en temps réel via l’API. L’annonce du 10 septembre vise l’un des points les plus difficiles de l’IA vocale: répondre vite, gérer les interruptions et paraître naturel dans le support, la vente, le coaching ou les assistants interactifs. OpenAI indique que le modèle est disponible dans Realtime API et conçu pour une interaction native voix à voix, plutôt qu’une chaîne séparant transcription, raisonnement texte et synthèse vocale.
Cette différence d’architecture compte. Beaucoup de robots vocaux transcrivent d’abord la parole en texte, envoient ce texte à un modèle, puis convertissent la réponse en audio. Chaque étape ajoute de la latence et peut perdre le ton, les pauses et les indices de conversation. Un modèle voix à voix conserve davantage de ces informations dans le même système. OpenAI affirme que GPT-Live-1 peut reconnaître les interruptions, poursuivre avec un rythme plus conversationnel et proposer des voix expressives sans obliger les développeurs à relier plusieurs services.
Le cas d’usage commercial est direct. Les entreprises veulent des agents capables de répondre aux appels, qualifier des prospects, programmer des rendez-vous, guider le dépannage et transférer à un humain quand nécessaire. En voix, la latence se remarque immédiatement. Une pause acceptable dans un chat peut sembler cassée au téléphone. Si GPT-Live-1 réduit l’attente et améliore les tours de parole, les développeurs pourront remplacer des menus téléphoniques rigides par des agents plus proches de représentants formés.
OpenAI présente aussi GPT-Live-1 comme un gain de productivité. Le modèle prenant en charge davantage de la boucle d’interaction, il réduit le code nécessaire aux agents vocaux. Il supporte l’appel d’outils, permettant de vérifier une commande, mettre à jour un dossier, réserver une réunion ou consulter un compte pendant la conversation. Cette puissance impose des contrôles: quels outils sont autorisés, comment le consentement est enregistré, que contiennent les logs et quand un humain reprend la main.
La voix IA devient très concurrentielle. Les produits crédibles devront offrir plus que des voix agréables: compréhension robuste malgré le bruit et les accents, permissions strictes, repli élégant en cas d’échec et indication claire que l’interlocuteur est une IA.