Google incorporó análisis de video basado en agentes a varios modelos Gemini Flash. La herramienta selecciona de forma autónoma las escenas, fotogramas, audio o transcripciones relevantes y, según la compañía, puede reducir el uso de tokens hasta 88% mientras mejora ligeramente la precisión en determinadas evaluaciones.
***
- Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite pueden buscar momentos específicos en videos largos sin procesar cada fotograma a una velocidad fija.
- Google afirma que el enfoque reduce hasta 88% los tokens y hasta 66% los costos, sin cobrar una tarifa adicional en la API.
- La función ya está disponible para desarrolladores y llegará posteriormente a la aplicación Gemini y a la herramienta Ask YouTube.
Google está incorporando análisis de video basado en agentes a varios modelos de la familia Gemini Flash, con un cambio importante en la manera en que la inteligencia artificial examina grabaciones extensas. En lugar de recorrer el material a una velocidad fija, el sistema busca dinámicamente las secciones que podrían responder a la consulta y decide qué señales necesita revisar, una estrategia que la compañía presenta como más eficiente y precisa.
La función apunta especialmente a tareas que requieren localizar escenas concretas dentro de tutoriales, conferencias o grabaciones de varias horas. Según Google, el nuevo método puede reducir el uso de tokens hasta 88% y los costos hasta 66%, mientras mantiene o incluso eleva ligeramente la precisión en determinadas evaluaciones comparativas.
Un modelo que decide dónde mirar
Los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite pueden analizar segmentos de menos de un segundo, incluidos cambios de estado y cortes que podrían perderse con un muestreo convencional de un fotograma por segundo. Esta capacidad resulta relevante para la edición automatizada, donde una transición breve o una modificación instantánea puede alterar el significado de una escena.
El sistema también puede localizar momentos específicos en horas de grabación sin consumir millones de tokens durante el proceso. Para ello, identifica ventanas de tiempo potencialmente relevantes y vuelve a muestrearlas a una velocidad de fotogramas más alta cuando detecta una anomalía o una señal que requiere mayor resolución temporal.
Además de encontrar escenas, Gemini puede contar movimientos repetidos y objetos individuales a lo largo del tiempo. La herramienta no se limita a observar imágenes, porque combina fotogramas, audio y transcripciones según la naturaleza de la tarea que el desarrollador le haya planteado.
Google sostiene que esta selección autónoma permite que el modelo concentre sus recursos en los momentos y señales que realmente importan. La consecuencia es un flujo de análisis menos rígido, en el que la inteligencia artificial decide qué examinar, a qué velocidad hacerlo y mediante cuál modalidad antes de entregar una respuesta.
Del escaneo fijo a la visión agéntica
Hasta ahora, Gemini utilizaba un procesamiento estático que, de manera predeterminada, muestreaba el video a un fotograma por segundo, aunque los desarrolladores podían ajustar esa configuración mediante la API. Desde el lanzamiento del análisis nativo de video en 2025, el sistema combinaba el estudio de los fotogramas con la transcripción de la pista de audio.
El enfoque basado en agentes conecta el razonamiento del modelo directamente con las herramientas nativas de video. De acuerdo con Google, Gemini puede iniciar un ciclo de búsqueda, recuperar una parte concreta del archivo, observar el resultado y decidir si necesita consultar otro segmento, aumentar la velocidad de muestreo o cambiar de modalidad.
La lógica se relaciona con la visión agéntica que Google presentó para Gemini 3 Flash en enero. Aquella función permitía que el modelo escribiera y ejecutara código Python para ampliar, recortar y anotar imágenes, además de comprobar cada resultado mediante un ciclo de pensar, actuar y observar.
Cuando Google anunció Gemini 3 Flash en diciembre, la empresa también había señalado el razonamiento visual y espacial para video como una capacidad futura. La nueva herramienta lleva esa dirección al análisis de grabaciones, aunque su disponibilidad inicial se concentra en la API y en las plataformas para desarrolladores.
Menos tokens en videos extensos
Las ventajas de eficiencia son más visibles en materiales largos, que pueden ir desde tutoriales de 10 minutos hasta conferencias de 90 minutos y archivos de varias horas. Con el método estático, los desarrolladores debían escoger entre asumir un consumo elevado de tokens o utilizar técnicas selectivas propias que podían descartar detalles relevantes.
Google afirma que sus resultados en 1H-VideoQA y LVBench muestran una caída de 88% en el uso de tokens, acompañada por un aumento ligero de la precisión. En la evaluación 1H-VideoQA de la compañía, Gemini 3.7 Flash con análisis basado en agentes alcanza la mayor precisión con el menor costo por consulta, según los datos presentados por la empresa.
La compañía también incluyó LongVideoBench entre las pruebas utilizadas para comparar el desempeño de los modelos. En ese conjunto de evaluaciones, Google describe a Gemini 3.7 Flash como la alternativa con la mayor calidad general y la mejor combinación entre precisión y eficiencia de costos.
Estos resultados son afirmaciones de Google y reflejan sus propios benchmarks, por lo que no equivalen por sí solos a una validación independiente de todos los escenarios de uso. Aun así, el ahorro potencial puede ser relevante para aplicaciones que procesan grandes bibliotecas audiovisuales, especialmente cuando cada consulta requiere buscar un instante concreto y no describir el video completo.
Disponibilidad para desarrolladores y usuarios
El análisis agéntico ya está activo para videos subidos y videos de YouTube mediante la API de Gemini en Google AI Studio y en Gemini Enterprise Agent Platform. Los desarrolladores deben configurar el modo de procesamiento como “agentic” dentro de la API para activar el comportamiento selectivo.
Google indicó que los usuarios pagarán las tarifas estándar de tokens de la API de Gemini y que no habrá un cargo adicional por utilizar esta modalidad. La documentación para desarrolladores contiene los detalles de configuración, mientras que la herramienta interna se encarga de recuperar únicamente las porciones relevantes del archivo.
Antes de esta actualización, los desarrolladores podían construir manualmente sistemas que buscaran segmentos específicos y combinaran fotogramas con audio o transcripciones. La diferencia es que Gemini ahora administra ese proceso de forma autónoma, sin exigir que cada aplicación defina por adelantado todas las reglas para seleccionar los momentos importantes.
Google planea extender la tecnología a sus propios productos en una fecha posterior. La empresa espera llevarla próximamente a todos los usuarios de la aplicación Gemini que utilicen dispositivos Flash y Flash Lite, mientras que en los próximos meses también prevé emplearla en la función Ask YouTube dentro de la página de reproducción.
Con esa integración, las respuestas podrían quedar más vinculadas a lo que realmente aparece en cada video, en vez de depender únicamente de una revisión uniforme de la grabación. El avance muestra cómo los modelos multimodales buscan reducir el costo de analizar grandes volúmenes de contenido, aunque su valor práctico dependerá de la precisión con que el agente seleccione cada segmento y de la consistencia de sus resultados.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Lores británicos piden poder para apagar sistemas de IA fuera de control
California
California se acerca a prohibir la vigilancia emocional con IA en el trabajo
Empresas
Adobe adquiere la startup india Rilo para reforzar sus flujos de marketing con IA
Hardware