Kyutai presentó Voice of Reason, dos modelos de voz con pesos abiertos que resuelven problemas matemáticos directamente desde el audio y elevaron su precisión en GSM8K hasta 77,1% mediante ajuste supervisado y aprendizaje por refuerzo.
***
- Voice of Reason parte de GLM-4-Voice-9B y evita una etapa intermedia de transcripción o un LLM de texto separado.
- El modelo directo alcanzó 70,3% y la variante Stitch llegó a 77,1% en GSM8K, según las ejecuciones publicadas.
- Ambos checkpoints pueden autoalojarse en una sola H100, aunque requieren el repositorio GLM-4-Voice para procesar el audio.
🧠🎙️ Kyutai alcanza 77,1% en GSM8K con Voice of Reason, un modelo que razona matemáticas desde el audio.
Pesos abiertos y ejecución en una H100.
La variante Stitch superó al modelo directo, que logró 70,3%, pero quedó detrás de sistemas textuales y en cascada. pic.twitter.com/7uWnjClrTb
— Diario฿itcoin (@DiarioBitcoin) September 23, 2026
Kyutai presentó Voice of Reason, una familia de dos modelos speech-to-speech con pesos abiertos diseñada para resolver problemas matemáticos expresados oralmente. La propuesta parte de GLM-4-Voice-9B y combina ajuste supervisado con aprendizaje por refuerzo, sin insertar una etapa de transcripción ni un modelo de lenguaje de texto independiente dentro del ciclo de respuesta.
Según la información publicada sobre el proyecto, el resultado más alto corresponde a la variante Voice of Reason Stitch, que alcanzó 77,1% en GSM8K en la ejecución publicada. El modelo directo llegó a 70,3%, una mejora considerable frente al 27,3% registrado por GLM-4-Voice y por encima del 58,7% obtenido anteriormente mediante el método STITCH.
Un reto particular para los modelos de voz
Los sistemas de voz suelen construirse como una cadena de reconocimiento automático del habla, razonamiento textual y síntesis de audio. Ese enfoque todavía conserva una ventaja en tareas complejas, pero cada etapa añade latencia y puede eliminar señales paralingüísticas, como el tono, que forman parte de la interacción hablada.
Los modelos speech-nativos enfrentan una limitación distinta: deben producir audio con intervalos regulares para mantener una conversación interactiva. Esa exigencia reduce el espacio disponible para generar tokens internos de razonamiento, porque el sistema necesita alternar entre pensar y hablar sin interrumpir demasiado la respuesta.
GLM-4-Voice refleja esa dificultad con una precisión de 27,3% en GSM8K, un conjunto de problemas matemáticos escolares utilizado para evaluar razonamiento. El método STITCH, desarrollado previamente por Chiang y sus colaboradores, elevó la cifra a 58,7% al insertar bloques de razonamiento, pero Kyutai buscó mejorar el desempeño con una receta de entrenamiento que incluyera aprendizaje por refuerzo.
La arquitectura de GLM-4-Voice intercala 13 tokens de texto y 26 tokens de audio de forma repetida. Esta organización permite que el modelo mantenga una salida hablada mientras construye la respuesta, aunque también obliga a diseñar con cuidado la cantidad de razonamiento que puede generar antes de volver a emitir sonido.
Entrenamiento supervisado y aprendizaje por refuerzo
La primera fase utilizó 150.616 problemas de Orca-Math, que Qwen3-235B reescribió para adecuarlos a la comunicación oral. Posteriormente, el sistema DSM TTS de Kyutai convirtió esas preguntas y respuestas en audio con múltiples voces, un procedimiento que permitió entrenar al modelo con variaciones de entonación y características vocales.
El ajuste supervisado por sí solo elevó la precisión de GLM-4-Voice desde 27,3% hasta 61,7% en GSM8K. La segunda fase añadió aprendizaje por refuerzo: ante cada pregunta, el modelo generó cuatro respuestas con una temperatura de 0,9 y recibió una recompensa binaria después de que un juez evaluara el texto decodificado.
El juez fue Qwen3-235B-A22B-2507 y no tuvo acceso a la respuesta de referencia durante la evaluación. En una revisión manual de 100 casos, sus decisiones coincidieron con las de evaluadores humanos en 88% de las ocasiones, mientras que el entrenamiento utilizó recompensas centradas dentro de cada grupo para construir un objetivo REINFORCE relativo.
El procedimiento se relaciona con GRPO, pero elimina tanto el recorte propio de PPO como la regularización KL. Kyutai ejecutó 1.500 actualizaciones de aprendizaje por refuerzo en 16 GPU H100, una escala que contrasta con el despliegue posterior de los checkpoints, capaces de funcionar en una sola H100 bajo precisión BF16.
Dos decisiones técnicas que cambiaron el resultado
Una de las decisiones más importantes fue corregir la temperatura durante el cálculo de la pérdida. El equipo dividió los logits por la temperatura de muestreo antes de aplicar el log-softmax, porque al retirar esa corrección la precisión de GSM8K se desplomó de 65,5% a 12,3%.
La segunda decisión consistió en fusionar los tokens de audio durante el entrenamiento. En cada posición correspondiente al audio, el sistema suma todas las probabilidades del vocabulario de audio en un único token abstracto, de modo que la pérdida evalúa si debe venir audio a continuación, pero no cuál token específico de audio aparecerá.
El trabajo sostiene que este estimador permanece sin sesgo y presenta menor varianza bajo una suposición de invariancia de valor. En términos prácticos, la técnica permite concentrar el aprendizaje por refuerzo en la decisión de hablar después de un bloque de texto, sin penalizar al modelo por escoger una unidad acústica particular.
Los resultados publicados utilizan decodificación top-k 50 y promedian tres semillas, por lo que la puntuación del modelo directo aparece como 65,5% con una variación de más o menos 1,1 puntos, mientras que la variante Stitch registra 74,8% con el mismo margen. Al eliminar top-k, las ejecuciones publicadas alcanzan 70,3% y 77,1%, respectivamente.
Dos modelos y sus límites actuales
El checkpoint glm-4-voice-of-reason-9b responde directamente y no incorpora tokens adicionales de razonamiento silencioso. Cuando desarrolla una solución paso a paso, ese proceso se pronuncia en voz alta, una característica que favorece la transparencia para el usuario, aunque puede producir respuestas más extensas que una solución breve.
La variante glm-4-voice-of-reason-stitch-9b añade bloques silenciosos de razonamiento de 100 tokens entre los segmentos hablados. Kyutai afirma que el modelo puede generar los bloques posteriores mientras reproduce el audio anterior, por lo que el razonamiento no necesariamente agrega latencia perceptible; en el diseño STITCH-R utilizado, el primer bloque de razonamiento aparece antes del primer bloque hablado.
La ventaja matemática no desapareció completamente cuando el sistema recibió habla real en lugar de audio generado con el mismo proceso de entrenamiento. Después de transcribir la entrada mediante Qwen3-ASR-1.7B, la variante Stitch obtuvo 72,0% con una variación de más o menos 1,9 puntos, una señal de que el rendimiento no depende únicamente de condiciones sintéticas.
La naturalidad vocal también se mantuvo prácticamente estable después del aprendizaje por refuerzo. La métrica UTMOSv2 pasó de 4,067 a 4,069 en el modelo directo y de 4,174 a 4,164 en Stitch, mientras que la duración media de la respuesta directa bajó de 41,9 a 36,4 segundos en vez de aumentar por la búsqueda de soluciones más largas.
Comparaciones, contaminación y disponibilidad
En la tabla de resultados, PersonaPlex de 8.000 millones de parámetros obtuvo 3,2%, GLM-4-Voice de 9.000 millones logró 27,3% y STITCH llegó a 58,7%. Voice of Reason alcanzó 65,5% más o menos 1,1 puntos, mientras que Voice of Reason Stitch registró 74,8% más o menos 1,1 puntos bajo la configuración evaluada con top-k.
Los sistemas de salida textual Qwen2.5-Omni y Qwen3-Omni lograron 84,7% y 94,6%, respectivamente, mientras que una cadena de reconocimiento de voz, LLM, síntesis de voz y nuevo reconocimiento llegó a 95,7%. Kyutai advierte que esas cifras pertenecen a sistemas más grandes o con arquitecturas distintas, por lo que no representan una comparación pareada con los dos modelos speech-nativos.
El aprendizaje por refuerzo mostró además un efecto relevante cuando se redujo la cantidad de datos supervisados. Con 10% de los datos de SFT, una ejecución más prolongada de RL alcanzó 58,5%, frente a 43,9% con SFT por sí solo, lo que sugiere que el mecanismo de recompensa puede compensar parcialmente la menor cobertura inicial.
El intercambio aparece en el conocimiento general: Spoken TriviaQA cayó de 40,6% a 34,0% en el modelo directo. Los autores atribuyen principalmente ese retroceso al SFT con el conjunto completo de datos y no al aprendizaje por refuerzo, una distinción importante para quienes pretendan usar el sistema fuera de las matemáticas.
Para revisar la contaminación, el equipo retiró AddSub, MultiArith, SingleEQ y SVAMP de la evaluación, y verificó 678 preguntas. El 54,0% presentó coincidencias a nivel de paráfrasis con Orca-Math, mientras que el audio de prueba provino de GPT-4o-mini-TTS, un sistema diferente del utilizado en el entrenamiento, y GPT-4o actuó como juez de evaluación.
Los dos checkpoints están disponibles con pesos abiertos y heredan la licencia de GLM-4-Voice, aunque ningún proveedor de inferencia de Hugging Face los aloja todavía. Para ejecutarlos, los usuarios deben recurrir al autoalojamiento, contar con una H100 y utilizar también el repositorio de GLM-4-Voice para el tokenizador y el decodificador de voz.
Voice of Reason no alcanza el desempeño de las arquitecturas textuales o en cascada más grandes, pero demuestra que un modelo puede mejorar sustancialmente su razonamiento oral sin abandonar una interacción nativa de audio. El avance también deja una advertencia: ganar precisión en una tarea especializada puede implicar perder conocimiento general, por lo que el despliegue dependerá del equilibrio entre velocidad, naturalidad y alcance.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Educación
Tether presenta Genesis III, un conjunto de datos de IA que alcanza 99,45% de respuestas válidas
Artículos
Xiaomi presenta HySparse2 para acelerar la IA con contextos de hasta un millón de tokens
Estados Unidos
Bernie Sanders anuncia un proyecto para prohibir la superinteligencia artificial
IA
