OpenAI hat am 10. September 2026 sein Full-Duplex-Sprachmodell GPT-Live-1 in der API freigeschaltet. Damit steht das gleiche Modell, das den Sprachmodus von ChatGPT antreibt, nun jedem Entwickler zur Verfügung, der eigene Sprachagenten bauen möchte.
Zuhören und sprechen zugleich
Anders als bei klassischen, rundenbasierten Sprach-APIs verarbeitet GPT-Live-1 eingehendes Audio, während es selbst spricht. Nutzer können also mitten im Satz unterbrechen, ohne dass das Gespräch abbricht. Laut OpenAI liefert das Modell native Transkripte, eine Turn-Erkennung, robusteren Umgang mit Hintergrundgeräuschen sowie Telefonie-Unterstützung für sprachbasierte Anwendungen. Zum Start stehen zwölf Stimmen bereit.
Preis und Einschränkungen
Der Zugang kostet nach OpenAI-Angaben 0,05 US-Dollar pro Minute, allerdings nur für die Sprachschicht. Das eigentliche „denkende“ Backend-Modell wird zusätzlich abgerechnet. Zu beachten: Der Vorgänger GPT-Realtime-2.1 verarbeitete auch Bild-Eingaben, diese Fähigkeit entfällt bei GPT-Live-1 laut den vorliegenden Berichten.
Benchmark als Anbieterangabe
OpenAI gibt an, GPT-Live-1 verbessere die Leistung im hauseigenen „Full Duplex Bench“ um 30 Prozentpunkte gegenüber GPT-Realtime-2.1. Dabei handelt es sich um eine Herstellerangabe; unabhängige Vergleichszahlen lagen zum Start noch nicht vor. Ob das Modell im Alltag hält, was die Demo verspricht, dürfte sich erst mit externen Tests zeigen.
Quellen: OpenAI-Ankündigung sowie Berichterstattung bei DataNorth (Stand: 10.09.2026).



















