Por Canuto  

Black Forest Labs presentó FLUX 3, un modelo de inteligencia artificial que integra imágenes, video y audio para generar contenido y predecir acciones robóticas desde una misma arquitectura.
***

  • FLUX 3 Video puede generar clips de hasta 20 segundos con audio nativo y varios modos de edición y continuación.
  • En pruebas preliminares, el modelo superó ampliamente a Luma Ray 3.2 y Runway Gen-4.5 en preferencias humanas.
  • El mismo backbone impulsa FLUX-mimic, una política robótica que opera en menos de 80 milisegundos en una RTX 5090.


Black Forest Labs lanza FLUX 3, un modelo multimodal para imágenes, video, audio y robots

Una arquitectura para describir el mundo

Black Forest Labs lanzó FLUX 3, un modelo de fundación multimodal que aprende de imágenes, videos y audio dentro de una única arquitectura. La compañía lo presenta como el primer modelo FLUX capaz de realizar predicciones de video, audio y acciones desde un solo conjunto de pesos.

El equipo de investigación sostiene que ninguna modalidad ofrece por sí sola una descripción completa del mundo. Las imágenes muestran la estructura espacial en un instante, mientras el video incorpora el tiempo y expone las dinámicas físicas.

El audio aporta otra capa de información, porque revela relaciones causales entre eventos mecánicos y sonidos. Un golpe, por ejemplo, no solo aparece como una imagen, sino también como un movimiento y una señal acústica vinculada al impacto.

Según la tesis de Black Forest Labs, cada modalidad funciona como una proyección con pérdidas de una misma realidad subyacente. Entrenar varias modalidades al mismo tiempo permite que se condicionen entre sí durante el aprendizaje.

En ese enfoque, el sonido debe coincidir con el impacto y el movimiento tiene que respetar la masa. La empresa afirma que FLUX 3 es su primer modelo construido completamente sobre ese principio de integración multimodal.

Self-Flow y la escala del entrenamiento

FLUX 3 utiliza Self-Flow, un método desarrollado por Black Forest Labs para alinear la generación y la comprensión multimodal dentro de una única arquitectura. La técnica combina un objetivo de coincidencia de flujo con otro de reconstrucción de características auto-supervisadas.

La implementación de referencia de Self-Flow está disponible en GitHub bajo la licencia Apache-2.0. Esa versión emplea SiT-XL/2 con condicionamiento temporal por token, una configuración orientada a organizar la información durante el proceso de generación.

El entrenamiento de referencia utiliza una relación de máscara por token del 25%. También incorpora auto-destilación desde un maestro EMA ubicado en la capa 20 hacia un estudiante situado en la capa 8.

El punto de control liberado corresponde a un modelo de investigación para ImageNet con resolución de 256 por 256 píxeles. No se trata de los pesos de FLUX 3, una distinción importante para quienes esperan descargar y ejecutar el nuevo sistema.

Self-Flow fue presentado en marzo de 2026, por lo que el método no constituye la novedad central de este lanzamiento. La diferencia, de acuerdo con la compañía, está en haber escalado de forma significativa los recursos computacionales y los datos para entrenar imagen, video y audio simultáneamente.

Video, audio y predicción de acciones

FLUX 3 Video puede generar clips de hasta 20 segundos en una sola generación, con audio nativo. El sistema admite texto a video, imagen a video y video a video a partir de un clip de referencia.

También ofrece generación basada en cuadros clave para controlar transiciones específicas. A esto se suma la continuación generativa de video y audio a partir de materiales de entrada, una función útil para extender secuencias existentes.

Black Forest Labs enumera diálogos multilingües, encadenamiento agéntico de clips en secuencias de múltiples tomas y generación de tipografía con diseños animados. El equipo destaca además el desempeño del modelo en expresiones faciales humanas.

La sincronización entre sonidos y eventos físicos aparece como otra de las fortalezas señaladas por la empresa. Esta capacidad busca reducir uno de los problemas frecuentes en los generadores audiovisuales: producir imágenes convincentes con sonidos que no corresponden a la acción.

El mismo backbone también impulsa FLUX-mimic, una política de robot que funciona en menos de 80 milisegundos en una tarjeta gráfica RTX 5090. La conexión entre generación multimodal y control robótico amplía el alcance del proyecto hacia aplicaciones de inteligencia artificial física.

Resultados preliminares y acceso restringido

Black Forest Labs publicó resultados preliminares basados en preferencias humanas. La evaluación utilizó clips de texto a video de 10 segundos, con resolución de 720p y audio.

FLUX 3 fue elegido frente a Luma Ray 3.2 en el 93% de las comparaciones. También obtuvo una preferencia del 77% frente a Runway Gen-4.5, según los resultados divulgados por el equipo.

Contra Grok Imagine Video, la cifra alcanzó hasta el 69%. El modelo registró además preferencias del 60% frente a Kling v3 Pro, del 59% frente a Happy Horse v1 y del 57% frente a Happy Horse 1.1.

La ventaja fue mucho más estrecha frente a Seedance 2.0 y Gemini Omni Flash. En esas comparaciones, FLUX 3 obtuvo un 52%, un resultado cercano a una distribución equilibrada entre ambas alternativas.

El acceso al modelo permanece restringido. Video y Acción están disponibles en acceso anticipado, Imágenes se incorporará después y Black Forest Labs indicó que los pesos abiertos llegarán al final.

El costo computacional de un modelo multimodal

La predicción de video consume más del 95% de la computación utilizada durante el entrenamiento de FLUX 3. Este dato muestra que la integración de modalidades no distribuye de manera uniforme las necesidades de procesamiento.

En contraste, el audio representa menos del 0,5% de los tokens empleados. Aunque ocupa una porción pequeña del conjunto, su incorporación puede ayudar a vincular eventos visuales con consecuencias sonoras.

La estrategia de Black Forest Labs apuesta por un modelo central que comparta conocimiento entre diferentes formas de información. En lugar de construir sistemas completamente separados, FLUX 3 intenta que una misma representación conecte escenas, sonidos y acciones.

Los resultados de preferencias humanas son preliminares y se limitan a una configuración concreta de evaluación. Los porcentajes no constituyen una medición universal del rendimiento en todas las tareas, resoluciones o tipos de contenido.

MarkTechPost informó que el lanzamiento combina generación audiovisual con predicción de acciones robóticas, aunque el acceso inicial no incluye todos los pesos del sistema. El avance, por tanto, se presenta tanto como una demostración técnica como un paso gradual hacia una disponibilidad más amplia.

Qué representa FLUX 3 para la inteligencia artificial

La propuesta refleja una tendencia creciente hacia modelos que procesan varias modalidades dentro de un mismo sistema. Para los usuarios, esto podría facilitar flujos de trabajo donde una imagen, un video, un sonido y una instrucción de acción formen parte de una sola secuencia.

En el ámbito audiovisual, la generación de clips de hasta 20 segundos con audio nativo apunta a producciones más completas desde una sola solicitud. Las funciones de referencia, continuación y cuadros clave añaden herramientas de control para transiciones y secuencias.

La inclusión de acciones robóticas introduce una dimensión distinta. Un sistema que conecte percepción, dinámica física y movimiento podría servir como base para políticas de control, aunque la noticia no detalla aplicaciones comerciales concretas ni resultados fuera del entorno anunciado.

El modelo también plantea desafíos de evaluación. Comparar sistemas audiovisuales requiere considerar calidad visual, coherencia temporal, sincronización sonora, obediencia a las instrucciones y consistencia de los personajes.

Por ahora, FLUX 3 llega con acceso anticipado para algunas funciones y con los pesos abiertos pendientes. Su importancia dependerá de cómo evolucione el acceso, de la validación independiente de sus resultados y de la capacidad del sistema para mantener coherencia al combinar modalidades.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín