Google actualizó Gemini Omni Flash con una versión que promete abaratar el video generado por inteligencia artificial, extender escenas con mayor coherencia y ofrecer controles más precisos sobre estilos, personajes y movimientos de cámara.
***
- Gemini Omni 1.1 Flash analiza hasta 10 segundos de video previo y permite extender escenas en tramos de 10 segundos hasta 40 segundos.
- Un modo de borrador a 360p funciona hasta 60% más rápido y cuesta un tercio del procesamiento en 720p.
- El servicio ofrece tarifas desde USD $0,03 por segundo y admite escalado hasta 1080p o 4K.
Google actualizó su modelo de generación de video Gemini Omni Flash a la versión 1.1, con cambios orientados a reducir costos y ampliar el control creativo. La compañía busca que los desarrolladores puedan producir escenas más extensas y consistentes sin depender exclusivamente de configuraciones de alta resolución, mientras incorpora herramientas para definir referencias visuales y movimientos entre fotogramas clave.
La actualización llega en un momento en que el precio, la continuidad narrativa y la estabilidad de personajes siguen siendo obstáculos para el uso habitual del video generado con inteligencia artificial. Según la información publicada por The Decoder, Gemini Omni 1.1 Flash ya está disponible mediante Google AI Studio y la documentación para desarrolladores de Google, por lo que sus funciones pueden probarse dentro de los recursos destinados a crear aplicaciones con los modelos de la empresa.
Más continuidad para las escenas
Una de las modificaciones centrales está en la función para extender escenas existentes. En lugar de analizar únicamente el último segundo del video original, Gemini Omni 1.1 Flash puede revisar hasta 10 segundos, una ventana más amplia que debería ayudar a conservar elementos visuales, ritmo y continuidad entre el material previo y la nueva secuencia.
El modelo permite ampliar las escenas en incrementos de 10 segundos, hasta alcanzar una duración total de 40 segundos. Este mecanismo ofrece un flujo de trabajo más gradual para los desarrolladores, quienes pueden evaluar cada tramo antes de seguir extendiendo la secuencia, en vez de solicitar de una sola vez un video largo y asumir un mayor riesgo de inconsistencias.
La revisión de un segmento más amplio también apunta a resolver uno de los problemas habituales de estos sistemas: cambios inesperados en la apariencia de los personajes, los objetos o el entorno cuando la acción continúa. La información disponible no garantiza que desaparezcan por completo esos errores, pero sí muestra que Google está ajustando el contexto visual utilizado por el modelo para mejorar la conexión entre escenas.
Para un productor de contenido, la diferencia puede ser relevante cuando una toma requiere conservar una dirección de movimiento o una composición determinada durante varios segundos. La extensión por etapas no sustituye la edición humana, aunque puede reducir la necesidad de regenerar una escena completa cada vez que el resultado pierde continuidad.
Referencias de estilo y control de cámara
Gemini Omni 1.1 Flash también permite cargar hasta tres segundos de material externo como referencia de estilo. Ese material puede servir para transferir personajes o patrones de movimiento, una capacidad que amplía el margen para mantener una identidad visual específica durante la generación de nuevas escenas.
La herramienta no se limita a copiar un fotograma aislado, según la descripción de la actualización, sino que utiliza un fragmento breve para orientar la apariencia o la dinámica de la secuencia. Para equipos pequeños, esta opción podría facilitar la creación de piezas con una estética coherente sin tener que describir cada detalle únicamente mediante instrucciones escritas.
Otra función permite establecer fotogramas de inicio y de fin para producir movimientos de cámara entre dos puntos clave. El desarrollador puede definir así una transición visual, mientras el modelo genera el desplazamiento intermedio, una posibilidad especialmente útil para planos que requieren acercamientos, recorridos o cambios de posición controlados.
El alcance práctico dependerá de la precisión con que el sistema interprete las referencias y de la estabilidad del resultado final. Aun así, la combinación de material externo, fotogramas clave y extensión progresiva coloca más decisiones de producción en manos del usuario, en lugar de dejar toda la composición a una instrucción general.
El costo como argumento de adopción
Google incorporó un modo de borrador a 360p que funciona hasta 60% más rápido y cuesta un tercio de lo que cuesta generar video a 720p. La configuración está pensada para revisar ideas y composiciones antes de invertir en una versión de mayor resolución, de modo que los usuarios puedan descartar resultados débiles con un gasto menor.
La estructura de precios de Gemini Omni 1.1 Flash parte de USD $0,03 por segundo para videos de 360p y llega a USD $0,30 por segundo en 4K. La generación a 720p cuesta USD $0,10 por segundo, mientras que la opción de 1080p tiene un precio de USD $0,15 por segundo.
En términos de una pieza de 10 segundos, esas tarifas equivalen a USD $0,30 en 360p, USD $1 en 720p, USD $1,50 en 1080p y USD $3 en 4K. El cálculo muestra cómo el modo de borrador puede funcionar como una etapa de selección económica, aunque el costo acumulado aumentará según el número de intentos y extensiones que realice cada usuario.
La tabla comparativa incluida en la información de la actualización sitúa a Gemini Omni 1.1 Flash en USD $0,10 por segundo para 720p, el mismo precio indicado para Gemini Omni Flash. En esa comparación, Veo 3.1 Lite aparece con tarifas de USD $0,05 por segundo en 720p y USD $0,08 en 1080p, mientras Veo 3.1 Fast figura con USD $0,10 en 720p, USD $0,12 en 1080p y USD $0,30 en 4K.
Resolución, escalado y acceso
El flujo de trabajo de Gemini Omni 1.1 Flash separa la fase de prueba de la entrega final. Los videos creados en el modo de borrador de 360p pueden escalarse posteriormente a 1080p o 4K, lo que permite experimentar con una salida de menor resolución antes de decidir si una versión terminada justifica un procesamiento más costoso.
El escalado no elimina la necesidad de revisar la calidad del material original, porque aumentar la resolución no corrige automáticamente problemas de movimiento, composición o identidad visual. Su utilidad principal consiste en permitir que la exploración inicial y la producción de alta definición formen parte de un mismo proceso, con decisiones de gasto más controladas.
Google ofrece Omni 1.1 Flash a través de Google AI Studio y de su documentación para desarrolladores. Ese acceso coloca el modelo dentro de un entorno orientado a pruebas e integración, en lugar de presentarlo únicamente como una herramienta cerrada para consumidores finales.
La disponibilidad para desarrolladores también deja abierta la posibilidad de que terceros incorporen el modelo en aplicaciones y flujos de producción propios, aunque la información de origen no detalla límites de uso, condiciones comerciales adicionales ni requisitos técnicos más allá de los precios por segundo. Por ahora, la novedad más concreta es la combinación de generación más económica, extensiones de hasta 40 segundos y controles visuales más específicos.
La estrategia de Google refleja una competencia cada vez más enfocada en el costo por segundo y en la capacidad de mantener una escena estable, no solamente en la calidad de una imagen individual. Para los usuarios, la promesa resulta atractiva porque reduce el precio de las pruebas, pero la evaluación real dependerá de cuántas regeneraciones sean necesarias para obtener un resultado utilizable.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
MIT crea una IA que diseña proteínas sin copiar a la naturaleza
Hardware
Architect Labs presenta Redwood, un acelerador de IA diseñado de extremo a extremo por una máquina
Empresas
Rivian enfrenta la salida de su directora financiera en plena expansión del R2
Bitcoin