Por Canuto  

OpenAI lanzó GPT Transcribe y GPT Live Transcribe para competir en el mercado de reconocimiento de voz. Aunque el nuevo modelo mejora la precisión, acelera el procesamiento y reduce el precio, ElevenLabs, Google y Mistral todavía registran mejores tasas de error.
***

  • GPT Transcribe obtuvo una tasa de error de palabras de 3,31%, una mejora de 0,7 puntos porcentuales frente a GPT-4o Transcribe.
  • El modelo procesa archivos pregrabados cerca de 34 veces más rápido que en tiempo real y cuesta USD $0,0045 por minuto.
  • ElevenLabs, Google y Mistral superan a OpenAI en el ranking AA-WER, mientras Voxtral Transcribe V2 ofrece el menor precio mencionado.


OpenAI presentó GPT Transcribe y GPT Live Transcribe, dos modelos de reconocimiento de voz disponibles mediante su API. La compañía busca mejorar sus herramientas para convertir audio en texto, tanto en archivos pregrabados como en conversaciones que requieren procesamiento inmediato.

GPT Transcribe está orientado a archivos de audio pregrabados. Según la información publicada por The Decoder, el modelo puede procesar ese material aproximadamente 34 veces más rápido que en tiempo real.

GPT Live Transcribe responde a una necesidad distinta: la transcripción continua con baja latencia. Su diseño apunta a escenarios donde el texto debe generarse mientras ocurre la conversación o se reproduce el audio.

La actualización llega con una mejora en precisión frente a la generación anterior. Sin embargo, los resultados disponibles muestran que OpenAI todavía enfrenta una competencia fuerte en un mercado donde pequeñas diferencias en los errores pueden influir en la elección de una herramienta.

La comparación se basa en AA-WER, una prueba que mide la tasa de error de palabras. Este indicador permite observar cuántas palabras se transcriben de forma incorrecta y facilita la comparación entre distintos modelos de reconocimiento de voz.

GPT Transcribe mejora frente a su predecesor

Artificial Analysis reportó que GPT Transcribe alcanzó una tasa de error de palabras de 3,31% en el benchmark AA-WER. La cifra representa una mejora de 0,7 puntos porcentuales frente a GPT-4o Transcribe, presentado un año antes.

La diferencia muestra un avance en la capacidad de OpenAI para interpretar grabaciones de voz. Aun así, el resultado no fue suficiente para colocar al nuevo modelo en la primera posición del ranking evaluado.

El precio también cambió con esta generación. GPT Transcribe cuesta USD $0,0045 por minuto de audio, una reducción de 25% frente al precio asociado con la versión anterior.

La tarifa puede ser relevante para desarrolladores que procesan grandes cantidades de audio. En esos casos, el costo por minuto se convierte en un factor tan importante como la precisión del texto generado.

Los dos modelos admiten texto como contexto de transcripción, palabras clave y varios idiomas de entrada. Estas funciones permiten orientar el reconocimiento hacia términos específicos y aportar información adicional antes de procesar el audio.

ElevenLabs, Google y Mistral mantienen la ventaja

El ranking AA-WER citado por The Decoder coloca a varios competidores por delante de OpenAI. ElevenLabs Scribe v2 lidera la clasificación con una tasa de error de 2,3%.

Google ocupa el segundo lugar con Gemini 3 Pro, que registró una tasa de error de 2,9%. La diferencia frente a GPT Transcribe es de 0,41 puntos porcentuales en la medición mencionada.

Mistral aparece después con Voxtral Small y una tasa de error de 3%. Aunque la distancia con OpenAI es menor, el resultado mantiene a la empresa francesa por delante en precisión dentro de esta comparación.

La competencia no se limita al desempeño técnico. Mistral también redujo los precios del mercado con Voxtral Transcribe V2, cuyo costo comienza en USD $0,003 por minuto.

Ese precio inicial es inferior al de GPT Transcribe. La comparación deja a los desarrolladores frente a una decisión que combina precisión, velocidad, funciones de contexto y costo operativo.

Una estrategia de voz más amplia para OpenAI

Los nuevos modelos amplían la oferta de OpenAI en reconocimiento de voz. GPT Transcribe atiende el procesamiento de archivos, mientras GPT Live Transcribe se concentra en experiencias de transmisión con baja latencia.

Ambas herramientas aceptan texto como contexto de transcripción. También permiten utilizar palabras clave, una función que puede ayudar a preservar términos importantes durante el reconocimiento.

La compañía publicó los detalles técnicos y operativos en su Guía de Transcripción de OpenAI. Esa documentación reúne la información destinada a quienes buscan integrar los modelos mediante la API.

Los modelos de transcripción complementan el modelo de generación en tiempo real anunciado recientemente por OpenAI. Esa oferta también incorpora GPT-Realtime-Whisper, un modelo de transcripción en tiempo real.

La combinación muestra que OpenAI está desarrollando una estrategia que abarca distintas etapas del flujo de voz. El procesamiento de grabaciones y la respuesta instantánea requieren prioridades técnicas diferentes.

Precio y precisión definirán la competencia

La posición de GPT Transcribe refleja una mejora clara, pero también evidencia el nivel de presión que enfrenta OpenAI. ElevenLabs, Google y Mistral obtuvieron mejores tasas de error en el benchmark AA-WER citado.

Una tasa de error inferior puede ser especialmente valiosa cuando la transcripción se utiliza para documentos, atención al cliente o registros de conversaciones. La noticia no detalla casos de uso específicos ni ofrece una evaluación separada por idioma.

El costo, por su parte, puede modificar la decisión de los usuarios con presupuestos limitados. Voxtral Transcribe V2 parte de USD $0,003 por minuto, frente a los USD $0,0045 por minuto de GPT Transcribe.

La velocidad representa otro elemento de comparación. OpenAI afirma que GPT Transcribe procesa audio pregrabado aproximadamente 34 veces más rápido que en tiempo real, una capacidad que puede reducir los tiempos de espera.

El mercado todavía no tiene un ganador definitivo en todas las variables. Los resultados disponibles presentan una competencia abierta entre precisión, precio, velocidad, compatibilidad lingüística y herramientas para orientar la transcripción.

Con GPT Transcribe y GPT Live Transcribe, OpenAI mejora su posición respecto a su generación anterior. Sin embargo, el ranking AA-WER indica que la compañía deberá seguir avanzando si quiere superar a los modelos que actualmente registran menos errores.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín