xAI lanzó el 18 de septiembre de 2026 Grok Voice Transcribe 2.0, una API alojada que promete duplicar la precisión de su versión anterior sin aumentar el precio. El modelo apunta a llamadas ruidosas, voces superpuestas, acentos locales y transcripciones multilingües, mientras Atlassian Loom ya lo utiliza para sus videos.
***
- xAI afirma que Grok Voice Transcribe 2.0 es dos veces más preciso que la versión 1.0 al mismo precio.
- La API cuesta USD $0,10 por hora en procesamiento por lotes y USD $0,20 por hora en transmisión en tiempo real.
- La empresa reporta el primer lugar entre 32 modelos de streaming y una reducción de la WER multilingüe del 20,6% al 6,8%.
🚨 xAI lanza Grok Voice Transcribe 2.0
Promete duplicar la precisión sin subir tarifas. La WER multilingüe bajó de 20,6% a 6,8%.
Cuesta US$0,10/h por lotes y US$0,20/h en tiempo real.
Atlassian Loom ya lo usa. Solo está disponible vía API. pic.twitter.com/wfbYNY0obL
— Diario฿itcoin (@DiarioBitcoin) September 19, 2026
xAI lanzó el 18 de septiembre de 2026 Grok Voice Transcribe 2.0, un modelo de voz a texto diseñado para convertir grabaciones y conversaciones en texto mediante una API alojada. El equipo de desarrollo asegura que la nueva versión duplica la precisión de Grok Voice Transcribe 1.0 sin modificar sus tarifas, una promesa dirigida especialmente a empresas que procesan llamadas, videos y comandos de voz a gran escala.
El servicio está disponible con el identificador grok-voice-transcribe-2.0 y funciona tanto por lotes como en transmisión en tiempo real. Sin embargo, xAI no anunció pesos abiertos, por lo que los clientes deben consumir el modelo mediante la API y no pueden instalarlo directamente en sus propios servidores.
Un modelo orientado al audio más difícil
Grok Voice Transcribe 2.0 se construyó sobre el modelo fundacional de audio utilizado por Grok Voice, según la información divulgada por xAI. La empresa sostiene que ese sistema ya administra decenas de miles de llamadas de soporte al cliente cada día, transcribe millones de horas de narración de video y alimenta el asistente Grok integrado en vehículos Tesla.
La estrategia de entrenamiento busca acercarse a las condiciones reales en las que suelen fallar los sistemas de reconocimiento de voz. Para ello, xAI describe el uso de audio en vivo, con ruido, múltiples idiomas y grabaciones realizadas en entornos diversos, seguido de una etapa de postentrenamiento destinada a mejorar el desempeño en escenarios concretos.
El modelo apunta a líneas telefónicas con baja calidad, voces simultáneas, acentos locales y credenciales habladas, como números telefónicos, correos electrónicos y direcciones. Estas situaciones exigen algo más que reconocer palabras aisladas, porque el sistema debe separar interlocutores, interpretar formatos especiales y conservar información que puede perderse cuando el audio llega comprimido o interrumpido.
En el modo por lotes, el endpoint acepta archivos de hasta 500 MB en 12 formatos de audio y también permite trabajar con archivos alojados en URL. Para los desarrolladores que necesitan respuestas inmediatas, la transmisión se realiza mediante WebSocket en wss://api.x.ai/v1/stt, con soporte para Opus a aproximadamente 4 KB por segundo, frente a los 48 KB por segundo del PCM sin comprimir a 24 kHz.
Las métricas y sus límites
xAI reporta que Grok Voice Transcribe 2.0 ocupa el primer lugar en precisión entre 32 modelos de streaming dentro del tablero público de Artificial Analysis. La medición AA-WER Streaming utiliza alrededor de ocho horas de audio y pondera el conjunto AA-AgentTalk con 50%, VoxPopuli con 25% y Earnings22 con el 25% restante.
La tasa de error de palabras, conocida como WER, representa la proporción de palabras que el sistema transcribe de manera incorrecta frente al contenido de referencia. Aunque esta métrica facilita las comparaciones, sus resultados pueden variar según el idioma, el ruido, la calidad del audio, la presencia de varios hablantes y la forma en que cada conjunto de datos define una transcripción correcta.
Además de la medición pública, xAI comparó las versiones 1.0 y 2.0 en cuatro conjuntos internos extraídos de tráfico de producción. Esos grupos abarcan telefonía en inglés a 8 kHz, conversaciones en inglés con Grok, credenciales como números y correos electrónicos, y frases cortas de asistentes de voz en 19 idiomas.
La empresa afirma que la segunda versión mejora a la primera en los cuatro conjuntos y que supera a todos los modelos evaluados por xAI en telefonía. Estos datos internos proceden del propio proveedor y todavía no cuentan con una reproducción independiente, una precisión importante para clientes que deban evaluar el sistema antes de trasladar procesos sensibles a la nube.
Idiomas, funciones y costos
La mejora que xAI presenta como más relevante frente a la versión 1.0 corresponde a la transcripción multilingüe. Grok Voice Transcribe 2.0 detecta automáticamente el idioma, trabaja con docenas de lenguas y puede procesar cambios de idioma durante una misma grabación, sin obligar al usuario a dividir el audio en varias solicitudes.
El avance resulta especialmente visible en las frases cortas, donde el sistema dispone de poco contexto para identificar correctamente la lengua. En el conjunto de comandos de voz en 19 idiomas, la WER habría caído de 20,6% a 6,8%, equivalente a aproximadamente 67% menos errores de palabra, mientras la documentación enumera 25 idiomas para escribir números, monedas y unidades.
La misma API reúne marcas de tiempo de inicio y final para cada palabra, puntuaciones de confianza, diarización de hablantes y transcripción independiente de hasta ocho canales. También ofrece sesgo de términos clave, con hasta 100 expresiones por solicitud y un máximo de 50 caracteres para cada una, una función útil en dominios con nombres técnicos o vocabulario especializado.
El servicio incluye además formato automático para números, fechas, monedas, teléfonos y correos electrónicos, así como eliminación predeterminada de muletillas como “eh” y “emm”. Su detección inteligente de turnos utiliza un modelo de aprendizaje automático para estimar cuándo termina la intervención de una persona, una capacidad pensada para agentes de voz que deben responder sin interrumpir constantemente.
El precio del procesamiento por lotes permanece en USD $0,10 por hora de audio, mientras que el streaming cuesta USD $0,20 por hora. xAI incluye sin recargo la diarización, las marcas de tiempo y el sesgo de términos clave, lo que equivale aproximadamente a USD $1,67 y USD $3,33 por cada 1.000 minutos, respectivamente.
El caso de Atlassian Loom
Atlassian Loom incorporó Grok Voice Transcribe 2.0 para transcribir cada video de su plataforma, después de considerar que el modelo era más preciso que su solución existente. La adopción ofrece un primer ejemplo empresarial del uso anunciado por xAI, aunque la información disponible no detalla volúmenes, ahorros ni métricas independientes obtenidas por Loom.
El flujo descrito por xAI conecta la grabación de un video con su transcripción y una posterior programación de tareas. Un usuario puede registrar en Loom un plan de acción, enviar el texto a Cursor y utilizar esa información para ejecutar actualizaciones de código, un recorrido que intenta reducir la distancia entre el contexto expresado de forma oral y el trabajo técnico posterior.
Sanchan Saxena, vicepresidente sénior de Teamwork Collection en Atlassian, describió el proceso como “cerrar el círculo del contexto al código”. La frase resume una tendencia en las herramientas de productividad: convertir reuniones, instrucciones y explicaciones habladas en insumos estructurados para otros sistemas de software.
El caso también muestra por qué la precisión en credenciales, frases breves y cambios de idioma puede tener consecuencias prácticas más allá de una transcripción legible. Un error en un nombre propio, un número telefónico, una dirección de correo o una instrucción de programación puede obligar a revisar el material y reducir parte del beneficio que promete la automatización.
Una API sin autoalojamiento
La disponibilidad exclusiva mediante API simplifica el despliegue para equipos que no desean administrar infraestructura especializada de reconocimiento de voz. A cambio, las empresas deben considerar la dependencia del proveedor, el envío de grabaciones a un servicio externo y la necesidad de controlar cuidadosamente los datos que contienen llamadas, identificadores o información operativa.
Para realizar una solicitud por lotes, los desarrolladores deben autenticarse con una clave de xAI, indicar el modelo y adjuntar el archivo de audio. Un ejemplo de llamada utiliza el endpoint https://api.x.ai/v1/stt, define grok-voice-transcribe-2.0 como modelo, activa el formato de texto y especifica el idioma inglés.
La arquitectura permite elegir entre menor latencia y menor consumo de ancho de banda, según el caso de uso. El procesamiento por lotes encaja en bibliotecas de videos o archivos acumulados, mientras el streaming está dirigido a agentes de voz, asistentes y aplicaciones que necesitan convertir el audio en texto mientras la conversación todavía ocurre.
Por ahora, la decisión central para los usuarios consiste en evaluar si las mejoras reportadas justifican migrar desde la versión anterior o desde otra plataforma. El doble de precisión anunciado, el descenso de la WER multilingüe y las funciones incluidas son argumentos comerciales relevantes, pero los resultados internos deberán contrastarse con pruebas propias en los idiomas, acentos y condiciones acústicas de cada organización.
Grok Voice Transcribe 2.0 llega así como una actualización enfocada en producción, no como un modelo abierto para investigadores o desarrolladores que busquen autoalojamiento. Su propuesta combina tarifas sin cambios, compatibilidad con lotes y tiempo real, herramientas de estructuración del texto y una apuesta por escenarios de audio donde el ruido y la falta de contexto suelen elevar los errores.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Bitcoin
Robinhood enfrenta críticas por un spread cercano al 2% en operaciones con BTC
Empresas
Microsoft advierte que el modo IE de Edge tiene los días contados
Blockchain
India obliga a Truecaller y otras apps a compartir reportes de spam con las operadoras
California

