Por Canuto  

Microsoft presentó MAI-Transcribe-2, un modelo de reconocimiento de voz que, según la empresa, combina una precisión líder en 60 idiomas con menor latencia y un precio anunciado de USD $0,10 por hora de audio.
***

  • MAI-Transcribe-2 registra una tasa promedio de error de palabra de 5,2% en el benchmark FLEURS y cubre 60 idiomas.
  • Microsoft afirma que el modelo procesa audio hasta 10 veces más rápido que GPT-Transcribe y ofrece funciones avanzadas de diarización.
  • Microsoft anuncia un precio de USD $0,10 por hora de audio.


Microsoft presentó MAI-Transcribe-2, un nuevo modelo de reconocimiento de voz que la compañía describe como su sistema de transcripción más capaz hasta ahora. El lanzamiento, fechado el 3 de septiembre de 2026, coloca el foco en tres variables decisivas para los desarrolladores: precisión, velocidad de procesamiento y costo, mientras incorpora herramientas destinadas a usos profesionales como la documentación clínica, los subtítulos y los registros legales.

De acuerdo con Microsoft AI, MAI-Transcribe-2 supera a modelos como Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large y ScribeV2 en las evaluaciones citadas por la empresa. La afirmación corresponde a los resultados presentados por Microsoft y no debe interpretarse como una certificación independiente de que el modelo sea superior en todas las condiciones, idiomas o aplicaciones posibles.

Un modelo diseñado para audio del mundo real

La propuesta busca resolver una dificultad habitual de la conversión de voz a texto: las grabaciones reales rara vez ocurren en ambientes perfectamente controlados. Reuniones con ruido, conversaciones con varias personas, cambios espontáneos de idioma y terminología especializada pueden reducir la calidad de una transcripción, por lo que MAI-Transcribe-2 incorpora herramientas orientadas a esos escenarios.

Entre sus funciones figura la diarización de hablantes, que permite distinguir quién interviene en una grabación y atribuir cada segmento a la persona correspondiente. Esta capacidad puede resultar especialmente útil en entrevistas, llamadas, reuniones corporativas y expedientes legales, donde identificar correctamente al hablante importa tanto como reconocer las palabras pronunciadas.

El sistema también ofrece marcas de tiempo a nivel de palabra, en lugar de limitarse a ubicar cada bloque de texto dentro de un intervalo amplio. Con esa información, los desarrolladores pueden mejorar la búsqueda dentro de un archivo, sincronizar subtítulos, navegar por una grabación y editar contenido audiovisual con una alineación más precisa entre audio y texto.

Otra herramienta es el sesgo de palabras clave, pensado para ayudar al modelo a reconocer nombres, abreviaturas y vocabulario técnico que el contexto general podría volver ambiguos. Microsoft también señala que el modelo mantiene un rendimiento robusto en condiciones ruidosas, aunque la calidad final seguirá dependiendo de factores como la grabación, los micrófonos, el acento y la claridad de los participantes.

Velocidad y precisión en la competencia

La empresa sostiene que MAI-Transcribe-2 procesa audio hasta 10 veces más rápido que algunos competidores líderes, una ventaja relevante para aplicaciones que necesitan resultados con baja latencia. En las comparaciones citadas por Microsoft, el modelo aparece 10 veces por encima de GPT-Transcribe en velocidad, siete veces por encima de Scribe v2 de ElevenLabs y cinco veces por encima de Gemini 3.5 Transcribe.

Esas cifras describen las evaluaciones comunicadas por la compañía y dependen de la configuración utilizada, el tipo de procesamiento y las condiciones de cada prueba. La velocidad puede ser determinante para servicios de atención al cliente, asistentes de reuniones y herramientas de accesibilidad, porque reduce el tiempo entre la emisión de una frase y la disponibilidad de su versión escrita.

En precisión, MAI-Transcribe-2 ocupa, según Microsoft, el primer lugar en el benchmark multilingüe FLEURS para 60 idiomas, con una tasa promedio de error de palabra de 5,2%. La métrica Word-Error-Rate contabiliza discrepancias entre la transcripción y una referencia, pero su resultado promedio no significa que el desempeño sea idéntico en cada idioma ni que refleje todas las situaciones de uso.

Estas métricas deben interpretarse dentro de las condiciones específicas de cada evaluación. En términos prácticos, la posición descrita por Microsoft intenta mostrar que el modelo no intercambia simplemente calidad por rapidez, sino que busca mantener ambas características dentro de una combinación competitiva.

Sesenta idiomas y conversaciones multilingües

Uno de los principales argumentos del lanzamiento es la cobertura de 60 idiomas, que permite a los desarrolladores utilizar un único modelo para proyectos con necesidades lingüísticas diversas. Microsoft plantea que esta amplitud puede reducir la complejidad operativa y evitar que los equipos deban elegir sistemas distintos para cada idioma, además de ofrecer potenciales ahorros en el uso de GPU.

El modelo incluye identificación automática del idioma, de modo que los usuarios no tienen que especificarlo previamente en cada archivo. La función puede simplificar flujos de trabajo en los que llegan grabaciones heterogéneas, aunque la detección automática no elimina la necesidad de revisar transcripciones cuando existen dialectos, interferencias sonoras o cambios frecuentes entre lenguas.

MAI-Transcribe-2 también admite el llamado code switching, es decir, conversaciones que cambian naturalmente de un idioma a otro. La empresa menciona pares de uso común como el Hinglish y el Spanglish, una característica relevante para mercados y comunidades donde las personas alternan idiomas dentro de una misma oración o conversación sin seguir un patrón rígido.

Los estilos configurables amplían el control sobre el texto resultante. La opción verbatim conserva muletillas, repeticiones y falsos comienzos para tareas de cumplimiento o análisis, mientras que la opción clean elimina parte de esos elementos para entregar subtítulos, notas y documentos publicados con una lectura más fluida.

Precio, disponibilidad y posibles usos

La estructura de precios es otro componente central del anuncio: Microsoft anuncia un costo de USD $0,10 por hora de audio. Ese valor puede resultar atractivo para quienes procesan grandes volúmenes, aunque el gasto total de una implementación también dependerá de la infraestructura, el almacenamiento, la revisión humana y las herramientas que se construyan alrededor del modelo.

El precio bajo se vincula, según la explicación de Microsoft, con la eficiencia alcanzada por el sistema y su capacidad de procesar audio rápidamente. Para los desarrolladores, una reducción del costo por hora puede abrir espacio para transcribir más archivos o incorporar funciones de voz en productos que antes tenían restricciones presupuestarias, sin que eso garantice por sí solo una adopción generalizada.

La compañía indicó que MAI-Transcribe-2 puede probarse mediante Microsoft Foundry, MAI Playground y Open Router. La disponibilidad en esas plataformas permite que equipos técnicos y usuarios interesados evalúen la diarización, las marcas de tiempo, el sesgo de palabras clave y los estilos de salida antes de decidir si el modelo se ajusta a sus necesidades.

Las aplicaciones potenciales abarcan desde la toma de notas clínicas y la documentación legal hasta la accesibilidad, los subtítulos y el análisis de conversaciones. El desafío siguiente será comprobar cómo se comporta el modelo en flujos de trabajo concretos, especialmente cuando una transcripción incorrecta puede afectar decisiones profesionales, registros de cumplimiento o la interpretación de una conversación sensible.

El lanzamiento refleja la competencia creciente por convertir audio en datos utilizables con rapidez y costos cada vez menores. Microsoft presenta MAI-Transcribe-2 como un avance en esa carrera, pero la comparación definitiva dependerá de pruebas reproducibles, evaluaciones independientes y el desempeño sostenido del sistema fuera de los entornos de demostración.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín