Abstrakte KI-Visualisierung fuer ein neues Sprachmodell

OpenAI Opens Full-Duplex Voice Model GPT-Live-1 to Developers

El 10 de septiembre de 2026, OpenAI puso su modelo de voz de dúplex completo GPT-Live-1 disponible en la API. El mismo modelo que potencia el modo de voz de ChatGPT ahora está abierto a cualquier desarrollador que construye agentes de voz personalizados.

Escuchando y hablando a la vez

A diferencia de las tradicionales API de voz basadas en el turno, GPT-Live-1 mantiene el procesamiento de audio entrando mientras habla. Los que llaman pueden interrumpir la media-sentencia sin romper la conversación. Según OpenAI, el modelo envía transcripciones nativas, detección de turnos, mejor manejo de ruido de fondo y soporte de telefonía para despliegues telefónicos. Hay 12 voces disponibles en el lanzamiento.

Precios y compensaciones

Los precios de OpenAI acceden a $0.05 por minuto, pero eso solo cubre la capa de voz. Cualquier modelo de backend hace el razonamiento se factura en la parte superior. Una caveat: el predecesor GPT-Realtime-2.1 admitió entrada de imagen, una capacidad GPT-Live-1 gotas según los informes disponibles hasta ahora.

Benchmark es una reclamación de proveedores

OpenAI dice que GPT-Live-1 mejora el rendimiento en su «Full Duplex Bench» en 30 puntos porcentuales sobre GPT-Realtime-2.1. Esta es una cifra de proveedores; los números independientes no estaban disponibles en el lanzamiento. Si el modelo vive hasta la demo en la producción sólo será claro una vez que terceros pruebe la tierra.

Fuentes: Anuncio y presentación de informes de OpenAI DatosNo (al 10 de septiembre de 2026).

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Mastodon
Scroll al inicio