Le 10 septembre 2026, OpenAI a rendu disponible dans l’API son modèle de voix GPT-Live-1. Le même modèle qui alimente le mode vocal de ChatGPT est maintenant ouvert à tout développeur qui construit des agents vocaux personnalisés.
Écouter et parler immédiatement
Contrairement aux API vocales traditionnelles à tour de rôle, GPT-Live-1 continue de traiter l’audio entrant pendant qu’il parle. Les appelants peuvent interrompre la phrase moyenne sans rompre la conversation. Selon OpenAI, le modèle expédie des transcriptions natives, la détection des virages, une meilleure gestion du bruit de fond et le support téléphonique pour les déploiements par téléphone. Douze voix sont disponibles au lancement.
Prix et compromis
OpenAI offre un accès à 0,05 $ la minute, mais cela ne couvre que la couche vocale. Quel que soit le modèle moteur, le raisonnement est facturé en haut. Une mise en garde: le précédent GPT-Realtime-2.1 entrée d’image acceptée, une capacité GPT-Live-1 baisse selon les rapports disponibles jusqu’à présent.
Benchmark est une réclamation du fournisseur
OpenAI dit que GPT-Live-1 améliore les performances sur son banc duplex complet interne de 30 points de pourcentage par rapport à GPT-Realtime-2.1. Il s’agit d’un chiffre de fournisseurs; les numéros indépendants n’étaient pas disponibles au lancement. Le fait que le modèle soit à la hauteur de la démo en production ne deviendra clair qu’une fois que des tiers auront testé la terre.
Sources : Annonce d’OpenAI et rapports DonnéesNord (au 10 septembre 2026).



















