MiniMax H3 es un sistema de inteligencia artificial omni-modal que genera video y audio de alta calidad a partir de texto, imágenes, video o audio. Con capacidades de resolución 2K, audio estéreo y soporte para múltiples idiomas, esta tecnología abre nuevas posidades para la creación de contenido. Descubre su arquitectura, sus módulos y cómo puedes utilizarlo con su lanzamiento de código abierto.
***
- MiniMax H3 genera video y audio de forma conjunta, alcanzando resoluciones de hasta 2K y duraciones de hasta 15 segundos.
- El sistema se compone de tres módulos: H3-Context-IR, H3-Base y H3-Regenerate-2K, con H3-Base disponible en código abierto.
- Su arquitectura incluye un transformer de 33B parámetros y codificadores especializados para imagen, video y audio estéreo.
🎥🚀 ¡Llega MiniMax H3!
Un sistema de IA capaz de generar video y audio de alta calidad con solo una instrucción.
Alcanza resoluciones de 2K y audio estéreo nativo en múltiples idiomas.
Su código base está disponible para la comunidad, lo que democratiza el acceso a esta… pic.twitter.com/eRHlCBA3yR
— Diario฿itcoin (@DiarioBitcoin) August 3, 2026
MiniMax ha presentado su nuevo sistema generativo de propósito general, MiniMax H3, capaz de comprender y generar contenido multimodal de forma unificada. El modelo soporta entradas de texto, imágenes, video y audio, y produce videos con sonido estéreo nativo, alcanzando resoluciones de hasta 2K y una duración máxima de quince segundos. Esta tecnología representa un avance significativo en el campo de la inteligencia artificial generativa, al integrar múltiples modalidades en un solo pipeline.
El anuncio se realizó a través de la plataforma de Hugging Face, donde el equipo de MiniMax compartió detalles técnicos, especificaciones y el código del modelo base. La compañía ofrece tanto una API en línea como una aplicación web para acceder a las funcionalidades de H3, pero también ha liberado los pesos de H3-Base para que la comunidad pueda desplegarlo localmente.
Capacidades y especificaciones técnicas
MiniMax H3 está diseñado para tareas de generación de video y audio a partir de instrucciones complejas. Según la documentación, el sistema acepta especificaciones de salida muy variadas: la duración puede configurarse entre 4 y 15 segundos, y la relación de aspecto incluye formatos comunes como 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16. La resolución por defecto es de 768 píxeles en el lado más corto, pero mediante el módulo H3-Regenerate-2K se puede alcanzar calidad 2K.
El video se genera a 24 FPS y el audio sale en estéreo a 32 kHz. El diálogo es estable en once idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español, con soporte adicional para otros idiomas en distintos grados.
Existen dos variantes principales del modelo base: H3-Base-FL2VA y H3-Base-Ref2VA. La primera funciona en modo primer-y-último-cuadro, lo que permite generar video desde una o dos imágenes de entrada, o directamente desde texto. La segunda, Ref2VA, acepta referencias multimodales: hasta nueve imágenes, tres clips de video o audio, con un máximo de doce archivos por entrada.
Arquitectura modular: H3-Context-IR, H3-Base y H3-Regenerate-2K
El sistema completo de MiniMax H3 se divide en tres módulos con funciones específicas. El primero, H3-Context-IR, actúa como un preprocesador y orquestador de entradas multimodales. Interpreta las relaciones entre texto, imágenes, audio y video de referencia, y las convierte en una representación intermedia de contexto (Context-IR) que H3-Base puede entender. Este módulo es crítico para la calidad final, y por ahora solo está disponible a través de la API oficial.
El segundo módulo es H3-Base, el modelo generativo en sí mismo, que produce audio y video a resolución de 768p. Es un transformer denso de 33 mil millones de parámetros, con ramas AdaLN específicas por modalidad. Su diseño incluye una atención dispersa nativa que se introdujo en la etapa final de entrenamiento, pero la implementación se publicará en una futura actualización.
El tercer módulo, H3-Regenerate-2K, se encarga de mejorar la resolución a 2K. En lugar de usar un modelo de super-resolución convencional, este módulo realimenta la salida de 768p junto con el contexto original a H3-Base para regenerar el video en alta definición. Así se aprovechan las capacidades generativas del modelo y se recuperan detalles que otros métodos tendrían que adivinar, como texto pequeño o texturas finas.
Componentes técnicos: codificadores y VAE
H3-Base emplea múltiples codificadores especializados. El H3-Encoder utiliza los pesos completos preentrenados de Qwen3-VL-32B y entrega estados ocultos desde su capa 50 al transformer principal. Añade tokens especiales, como , que requieren la configuración del tokenizador incluida en el repositorio.
Para la representación latente de video y audio, se utilizan dos autoencoders: H3-VisualVAE y H3-AudioVAE. El VisualVAE es causal y temporal, con factores de compresión espacial de 16× y temporal de 4×, y 24 canales latentes. Antes de ingresar al transformer, las latencias visuales se parten en parches de 1×2×2 en las dimensiones tiempo, alto y ancho, lo que reduce el muestreo espacial efectivo a 32×.
El AudioVAE comprime audio de 32 kHz a una tasa temporal de 40 Hz por canal. Procesa los canales izquierdo y derecho de forma independiente y luego los combina, lo que permite entrada y salida de audio estéreo. Ambos VAE están optimizados para reconstrucción de calidad y para que el modelo generativo aprenda con facilidad.
Despliegue y casos de uso
MiniMax ha publicado los pesos del modelo H3-Base en dos puntos de control específicos por tarea: FL2VA y Ref2VA. Cada punto de control incluye el transformer, el processor, el tokenizador, el codificador de texto y los VAE. Para su despliegue, se recomiendan frameworks como SGLang, vLLM, diffusers y ComfyUI. En la documentación se proporcionan ejemplos de scripts de despliegue y casos reproducibles de generación de 768p.
También se detalla un flujo de trabajo completo de 2K que combina la API de H3-Context-IR y H3-Regenerate-2K con un H3-Base local. Este método permite reproducir la calidad de los videos generados directamente por la API de MiniMax, aunque el módulo de regeneración aún no es de código abierto. Los desarrolladores pueden seguir la guía de indicación proporcionada para crear sus propios sistemas de preprocesamiento.
El lanzamiento de MiniMax H3 marca un hito en la democratización de la generación de video con IA, al ofrecer un modelo base abierto que la comunidad puede adaptar y mejorar. Con su enfoque multimodal y su arquitectura eficiente, H3 promete acelerar la creación de contenido en múltiples industrias, desde el cine hasta la educación.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Qwen Studio: La nueva plataforma unificada de Alibaba Cloud para desarrolladores de IA
China
China revela mejoras secretas en su caza de sexta generación: ¿nueva era aérea?
Empresas
AstraZeneca explora la compra de Bristol Myers y crearía un gigante farmacéutico
Capital de Riesgo