Nvidia publicó Nemotron 3 Diarization, un modelo de pesos abiertos que identifica hasta ocho hablantes simultáneamente y puede operar con una latencia cercana a 320 milisegundos. La herramienta busca resolver uno de los problemas más persistentes de la transcripción automática: saber quién dijo cada frase cuando varias voces se superponen.
***
- Nemotron 3 Diarization cuenta con aproximadamente 100 millones de parámetros y procesa hasta ocho hablantes al mismo tiempo.
- En la prueba AISHELL-4 registró una Tasa de Error de Diarización de 9,8%, frente al 27,2% de su predecesor.
- El modelo está disponible sin costo en Hugging Face y mediante NeMo, además de proveedores de inferencia como Baseten y DeepInfra.
🎙️ Nvidia publica Nemotron 3 Diarization
Identifica hasta 8 hablantes en tiempo real, con latencia cercana a 320 ms.
En AISHELL-4 logró 9,8% de error, frente al 27,2% de su predecesor.
Disponible gratis en Hugging Face y NeMo. pic.twitter.com/PQkdXgHQp5
— Diario฿itcoin (@DiarioBitcoin) September 23, 2026
Un modelo diseñado para seguir voces
Nvidia publicó el 23 de septiembre de 2026 Nemotron 3 Diarization, un modelo de pesos abiertos creado para determinar quién habla, qué dice y en qué momento dentro de una conversación. La herramienta ataca un desafío central del procesamiento de audio, porque la transcripción puede registrar correctamente las palabras y aun así atribuirlas a la persona equivocada cuando varias voces intervienen al mismo tiempo.
El sistema tiene aproximadamente 100 millones de parámetros y puede identificar hasta ocho hablantes de manera simultánea, un límite que amplía de forma considerable el alcance de este tipo de soluciones. Nvidia también afirma que produce probabilidades de actividad de cada hablante con una resolución de 10 milisegundos, un nivel de detalle pensado para manejar interrupciones y momentos de crosstalk acelerado.
Nemotron 3 funciona tanto en transmisiones en directo como en procesamiento fuera de línea, por lo que puede adaptarse a reuniones, llamadas grabadas y otras aplicaciones de audio. En su modalidad de streaming, los perfiles de latencia configurables permiten reducir la espera hasta aproximadamente 320 milisegundos, una característica relevante cuando el análisis debe acompañar una conversación sin retrasos perceptibles.
El modelo está disponible bajo la licencia OpenMDW 1.1 de Nvidia, de forma gratuita a través de Hugging Face y del framework NeMo. También puede utilizarse mediante proveedores de inferencia como Baseten y DeepInfra, donde determinadas configuraciones llegan, según la información disponible, a un costo de USD $0,01 por hora de audio.
Una arquitectura que simplifica la diarización
La diarización consiste en separar una conversación según sus participantes y asignar cada fragmento de audio a la voz correspondiente. Los sistemas tradicionales suelen dividir el trabajo en varias etapas, comenzando por la segmentación del audio, continuando con la extracción de representaciones de cada hablante y terminando con una agrupación destinada a determinar quién es quién.
Nemotron 3 reúne esas tareas en una sola pasada mediante la arquitectura que Nvidia denomina Streaming Sortformer. Este diseño reduce la cantidad de componentes que los desarrolladores deben coordinar durante el despliegue, lo que puede facilitar la integración de la herramienta en productos de transcripción, plataformas de reuniones y servicios de análisis de llamadas.
Una de las piezas centrales del modelo es el Arrival-Order Speaker Cache, identificado por sus siglas AOSC. El sistema asigna las etiquetas de los hablantes según el orden en que aparecen por primera vez en la conversación, una estrategia que permite mantener el seguimiento mientras avanza el audio sin depender de una fase separada de agrupamiento.
La combinación entre procesamiento de una sola pasada, resolución de 10 milisegundos y perfiles de latencia configurables busca resolver dos problemas al mismo tiempo: disminuir la complejidad técnica y conservar suficiente precisión en conversaciones con interrupciones. Para los usuarios finales, el resultado esperado es una transcripción donde las intervenciones estén mejor organizadas, incluso cuando varias personas hablen casi simultáneamente.
Una mejora frente a su predecesor
En el benchmark AISHELL-4, Nemotron 3 alcanzó una Tasa de Error de Diarización de 9,8% utilizando su perfil de latencia baja. Esta métrica mide la proporción de tiempo en que el sistema atribuye una intervención al hablante incorrecto, omite a una persona o detecta actividad de voz que no corresponde a un participante.
El resultado representa una mejora frente al 27,2% registrado por Streaming Sortformer v2.1, el modelo anterior de Nvidia, que había sido lanzado en julio de 2025. La comparación muestra una reducción importante del error en la misma prueba, aunque la cifra corresponde a las condiciones específicas del benchmark y no garantiza idénticos resultados en todos los entornos de audio.
El predecesor, conocido formalmente como diar_streaming_sortformer_4spk-v2.1, también tenía una limitación de cuatro hablantes. Al duplicar esa capacidad hasta ocho participantes, Nemotron 3 puede atender escenarios que resultaban más difíciles para el sistema anterior, como paneles de discusión, reuniones multipartitas y llamadas grupales.
La publicación fue reportada por Crypto Briefing, que describió el lanzamiento como parte de una expansión de las capacidades de Nvidia en reconocimiento de voz e inteligencia artificial. El avance no elimina los desafíos propios de ambientes con ruido, acentos, micrófonos deficientes o voces superpuestas, pero ofrece una arquitectura más compacta y una mejora cuantificable en una prueba de referencia.
Aplicaciones y estrategia de Nvidia
Nemotron 3 Diarization forma parte de una familia más amplia de modelos que Nvidia desarrolla alrededor de la inteligencia artificial agéntica y el reconocimiento de voz. La compañía busca construir un conjunto de herramientas para aplicaciones basadas en voz, en lugar de limitarse a un modelo aislado dedicado únicamente a convertir audio en texto.
Entre los usos previstos aparecen la transcripción de reuniones, el análisis de centros de llamadas, la producción de podcasts y cualquier escenario donde un sistema deba conservar el registro de múltiples participantes. En esos contextos, identificar correctamente a cada hablante puede ser tan importante como reconocer las palabras, especialmente cuando las conversaciones generan tareas, decisiones o registros que después deben revisarse.
La liberación de los pesos bajo OpenMDW 1.1 también abre la puerta a integraciones externas y a despliegues que no dependan exclusivamente de una interfaz cerrada. Nvidia ya ha señalado integraciones tempranas mediante asociaciones con MLX y FluidAudio, aunque la disponibilidad del modelo no implica que todas las implementaciones tengan el mismo rendimiento o costo operativo.
El precio anunciado por ciertos proveedores de inferencia puede resultar atractivo para equipos que procesan grandes volúmenes de audio. A una tarifa de USD $0,01 por hora, una jornada laboral completa de ocho horas de reuniones costaría aproximadamente USD $0,08, aunque el gasto final dependerá de la configuración, el proveedor y la cantidad de audio enviada al servicio.
La combinación de pesos abiertos, compatibilidad con NeMo, procesamiento en streaming y soporte para ocho hablantes coloca a Nemotron 3 en una posición relevante dentro de las herramientas de audio generativo y reconocimiento de voz. El siguiente desafío será comprobar cómo se comporta fuera de los benchmarks y si los desarrolladores pueden convertir esa precisión y baja latencia en productos confiables para conversaciones reales.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Dines lanza Cartographer, el manual que UiPath propone para una IA autónoma confiable
Estados Unidos
Chicago propone frenar por 12 meses construcción de nuevos centros de datos
IA
YouTube impulsa los GIF en comentarios y nuevas formas de monetizar el fandom
Noticias
