OpenAI puso GPT-Live-1 a disposición de los desarrolladores como una API capaz de escuchar y hablar simultáneamente. El modelo promete conversaciones de voz con menor latencia, mayor precisión en llamadas a herramientas y nuevas opciones de personalización, aunque su costo de USD $0,05 por minuto plantea un desafío para los casos de uso intensivos.
***
- GPT-Live-1 incorpora conversación de voz full-duplex, con escucha y respuesta simultáneas.
- OpenAI reporta mejoras en interactividad, latencia y precisión frente a modelos anteriores.
- Yelp utiliza el modelo para reservas telefónicas y GPT-Live-1 suma doce nuevas voces.
🎙️ OpenAI lanza GPT-Live-1 como API
Escucha y responde simultáneamente con voz full-duplex.
Reporta 80,1% en interactividad, 0,8 s de latencia y 87% de precisión en llamadas a herramientas.
Incluye 12 voces. Costo: USD 0,05 por minuto. Yelp ya lo usa. pic.twitter.com/3FhdHwcA3t
— Diario฿itcoin (@DiarioBitcoin) September 10, 2026
Una API para conversaciones simultáneas
OpenAI puso GPT-Live-1 a disposición de los desarrolladores como una interfaz de programación de aplicaciones, o API, orientada a construir productos de voz más naturales. La característica central del modelo es su capacidad para escuchar y hablar al mismo tiempo, un funcionamiento conocido como full-duplex que ya opera dentro de ChatGPT. En lugar de esperar a que una persona termine por completo antes de procesar la siguiente respuesta, el sistema puede mantener ambos flujos activos durante la conversación.
Para quienes desarrollan asistentes telefónicos, esta capacidad apunta a reducir las pausas que suelen hacer que una interacción automatizada parezca rígida. GPT-Live-1 puede recibir audio, interpretar el turno conversacional y producir una respuesta de voz sin depender de una alternancia estricta entre escucha y habla. La fuente de la información señaló que OpenAI diseñó el modelo para aplicaciones donde la fluidez y la reacción inmediata tienen un peso importante en la experiencia del usuario.
La API también permite combinar GPT-Live-1 con distintos modelos de backend, según la tarea que deba resolver cada aplicación. Los desarrolladores pueden elegir entre más profundidad de razonamiento, mayor velocidad o un costo inferior, de acuerdo con las exigencias de su producto y con la complejidad de las solicitudes que reciban. Esa flexibilidad separa la interacción de voz de la lógica especializada que puede ejecutarse detrás de ella.
El precio anunciado representa, sin embargo, una consideración relevante para las empresas que planeen escalar llamadas durante largos periodos. OpenAI fija el uso de GPT-Live-1 en USD $0,05 por minuto, una tarifa que puede resultar significativa en servicios con grandes volúmenes de conversaciones. El costo obliga a evaluar qué interacciones necesitan realmente el modelo más avanzado y cuáles podrían resolverse con alternativas más económicas.
Mejoras reportadas en las pruebas
OpenAI afirma que GPT-Live-1 supera con claridad a sus predecesores en los benchmarks publicados para la tecnología de voz. En las pruebas de interactividad full-duplex, el modelo obtuvo un resultado de 80,1%, frente al 45,4% registrado por GPT-Realtime-2.1. La diferencia busca medir qué tan bien puede sostener el sistema una conversación en la que las personas hablan, interrumpen y reciben respuestas sin una separación rígida entre ambos turnos.
La latencia también muestra una reducción en las mediciones divulgadas por la compañía. El tiempo de los turnos conversacionales baja de 1,4 segundos a 0,8 segundos, una mejora que puede influir en la percepción de naturalidad durante una llamada. En servicios de atención al cliente, incluso una pausa relativamente breve puede alterar el ritmo de la conversación, aunque los resultados de un benchmark no garantizan por sí solos el mismo desempeño en todos los entornos.
Otra mejora aparece en la precisión de las llamadas a herramientas, una función necesaria cuando un asistente debe consultar sistemas externos o ejecutar acciones concretas. GPT-Live-1 alcanza una precisión de 87%, frente al 60% del modelo anterior, según los datos atribuidos a OpenAI. Una mayor exactitud en este punto puede ser especialmente importante para aplicaciones que necesitan consultar información o completar procesos mientras mantienen una conversación hablada.
En un benchmark de soporte de voz bancario, GPT-Live-1 obtuvo una tasa de aprobación de 32%, mientras que el modelo anterior alcanzó 12,4%. La cifra no equivale a una garantía de desempeño en servicios financieros reales, pero muestra el tipo de escenario que OpenAI utilizó para comparar las capacidades de sus modelos. Las empresas deberán considerar además sus propios requisitos de seguridad, supervisión y cumplimiento antes de trasladar estas pruebas a operaciones con usuarios.
Reservas telefónicas y nuevas voces
Yelp ya utiliza GPT-Live-1 para gestionar reservas telefónicas, de acuerdo con la información disponible sobre el lanzamiento. Alex Levy, director de tecnología de Yelp, reportó una mejor gestión de las llamadas mediante el modelo, aunque no se detallaron en la noticia cifras específicas sobre el volumen de reservas o el ahorro operativo. El caso muestra una aplicación concreta para una tecnología que busca llevar la conversación de voz en tiempo real a servicios comerciales.
Las reservas requieren que un sistema escuche datos, responda preguntas y coordine acciones sin perder el hilo de la conversación. En ese contexto, la combinación entre menor latencia y mayor precisión en llamadas a herramientas puede ayudar a que un asistente gestione solicitudes con menos interrupciones. Aun así, el resultado final dependerá de la integración con los sistemas de cada empresa y de la calidad de la información disponible para el modelo.
GPT-Live-1 incorpora además doce nuevas voces diseñadas para cubrir distintos acentos, dialectos e idiomas. La ampliación busca ofrecer a los desarrolladores más opciones para adaptar el tono de un asistente a diferentes públicos y mercados, sin limitar todas las aplicaciones a una única voz estándar. La variedad puede ser relevante para servicios internacionales, donde la claridad y la familiaridad del habla influyen en la confianza del usuario.
El modelo proporciona de forma nativa transcripciones de reconocimiento automático del habla, conocidas como ASR, y el texto de la respuesta generada. Esta disponibilidad simultánea de audio y texto puede facilitar el registro de llamadas, la revisión de interacciones y la conexión con sistemas que necesiten trabajar con información escrita. Los detalles técnicos y las condiciones de uso estarán disponibles en la documentación de la API de OpenAI, que los desarrolladores deberán consultar antes de implementar el servicio.
Implicaciones para el desarrollo de voz
La llegada de GPT-Live-1 como API amplía el acceso de terceros a una tecnología que hasta ahora también se asociaba con la experiencia de voz dentro de ChatGPT. Para las empresas, el cambio permite diseñar productos específicos alrededor de conversaciones habladas, en lugar de depender únicamente de una aplicación generalista. La posibilidad de escoger modelos de backend añade una capa de control sobre el equilibrio entre capacidad, velocidad y gasto.
Ese equilibrio será decisivo para las compañías que operen centros de atención o líneas automatizadas. Un modelo con mejores resultados puede elevar la calidad de una interacción, pero una tarifa de USD $0,05 por minuto puede acumularse rápidamente cuando se multiplican las llamadas. Por eso, el valor comercial de GPT-Live-1 no dependerá solo de sus benchmarks, sino también de cuánto tiempo necesite cada conversación y de la cantidad de tareas que pueda completar correctamente.
El formato full-duplex modifica además las expectativas sobre cómo debe comportarse un asistente de voz. La posibilidad de escuchar mientras habla puede permitir interrupciones más naturales y respuestas menos mecánicas, aunque también exige controlar con precisión cuándo el sistema debe ceder la palabra o continuar. Para los desarrolladores, esa complejidad convierte la integración, las pruebas y la supervisión en elementos tan importantes como la elección del modelo.
OpenAI indicó que todos los detalles estarán disponibles en la documentación de la API, donde los equipos técnicos podrán revisar las condiciones necesarias para incorporar GPT-Live-1. Por ahora, los datos divulgados presentan un modelo con mejoras importantes en interactividad, latencia, uso de herramientas y soporte de voz, además de doce nuevas voces. El siguiente desafío será comprobar cómo esas ventajas se traducen en aplicaciones reales, con costos sostenibles y resultados consistentes para los usuarios.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Europa
BNP Paribas advierte que la deuda de la IA puede romper el auge de los bonos corporativos
Empresas
Pocket FM afirma que su tasa de ingresos anualizada alcanzó USD $500 millones con apoyo de la IA
África
Hackers comercializan datos de más de 225.000 cuentas de FairMoney en Nigeria
Cadena de Suministros