Alibaba presentó Qwen3.8-Omni-Flash, un modelo multimodal orientado a agentes que analiza texto, imágenes, audio y video, con contexto de 1 millón de tokens, uso de herramientas y una estrategia para reducir el costo de procesar contenidos extensos.
***
- Qwen3.8-Omni-Flash recibe texto, imágenes, audio y video, pero genera únicamente respuestas de texto.
- Su percepción agéntica elevó la puntuación reportada en OmniVideoBench de 63,4 a 67,8 y redujo el uso de tokens en aproximadamente 45,7%.
- El modelo se ofrece como API alojada desde USD $0,15 por millón de tokens de entrada, sin pesos abiertos anunciados en su lanzamiento.
🚨 Alibaba presenta Qwen3.8-Omni-Flash
Texto, imagen, audio y video. Contexto de 1 millón de tokens. Salida solo en texto.
📉 OmniVideoBench: 67,8 puntos y 45,7% menos tokens, según Qwen.
💵 API desde USD 0,15 por millón. Sin pesos abiertos anunciados. pic.twitter.com/Ro73bpt4HW
— Diario฿itcoin (@DiarioBitcoin) September 18, 2026
Alibaba presentó Qwen3.8-Omni-Flash, un modelo multimodal que reúne comprensión audiovisual, razonamiento y uso de herramientas dentro de una misma arquitectura orientada a agentes. El sistema acepta texto, imágenes, audio y video, aunque su salida se limita al texto, y propone un flujo de trabajo basado en entender el contenido, planificar una tarea, ejecutarla mediante herramientas y entregar un resultado.
El lanzamiento se produjo el 18 de septiembre de 2026 y, por ahora, el modelo puede utilizarse mediante una API alojada en QwenCloud, Alibaba Cloud Model Studio y Qwen Studio. Alibaba no anunció pesos abiertos para Qwen3.8-Omni-Flash, por lo que los desarrolladores no cuentan con una opción de autoalojamiento desde el lanzamiento, una diferencia relevante frente a otros modelos de la familia Qwen que sí han sido distribuidos con mayor apertura.
Un modelo diseñado para actuar sobre contenido audiovisual
Qwen3.8-Omni-Flash está construido sobre la arquitectura Qwen3.8-Flash-Next, cuyos pesos abiertos fueron presentados en agosto de 2026. Su ventana de contexto alcanza 1 millón de tokens, mientras que QwenCloud especifica un máximo de entrada de 991.000 tokens y un máximo de salida de 131.000, cifras que permiten trabajar con documentos, grabaciones y videos extensos dentro de una misma interacción.
El modelo también admite una longitud máxima de razonamiento de 262.000 tokens, aunque esa capacidad no funciona como una salida visible convencional para el usuario. El pensamiento viene activado por defecto con el parámetro reasoning_effort configurado en xhigh, mientras que establecerlo en none desactiva esa función y ofrece a los desarrolladores mayor control sobre costo, velocidad y profundidad de procesamiento.
La API es compatible con los protocolos DashScope y OpenAI, y funciona tanto con Chat Completions como con la API de Responses. También incorpora llamadas a funciones, búsqueda web, salidas estructuradas, almacenamiento en caché de contexto y procesamiento por lotes, herramientas que convierten al modelo en una pieza potencial para flujos automatizados, en lugar de limitarlo a responder preguntas sobre una imagen o una grabación.
La orientación agéntica significa que el sistema no necesita revisar necesariamente cada segundo de un video con la misma intensidad. Según la explicación del equipo de Qwen, el agente comienza con la pregunta del usuario, decide qué debe observar y escuchar, y después recopila evidencia en varias rondas que avanzan desde una revisión general hacia segmentos más específicos.
Menos tokens para analizar videos largos
En muchos sistemas de comprensión de video, el modelo procesa una grabación extensa de principio a fin, incluso cuando la respuesta depende de un momento breve ubicado en algún punto del archivo. Qwen propone una estrategia distinta: asignar más cómputo y tokens a los fragmentos que parecen relevantes para la consulta, con una selección progresiva que busca equilibrar precisión y eficiencia.
El equipo de investigación reportó esa estrategia en OmniVideoBench, una evaluación centrada en la comprensión de contenidos audiovisuales. Allí, la precisión pasó de 63,4 a 67,8, mientras que el consumo de tokens descendió de 145.736 a 79.117, lo que representa una reducción aproximada de 45,7% en el material utilizado para producir la respuesta.
La reducción no implica que el modelo descarte el contexto sin criterio, sino que intenta concentrar su análisis en las partes relacionadas con la pregunta. Para aplicaciones como revisión de clases, búsqueda de momentos específicos, análisis de reuniones o creación de notas audiovisuales, esa decisión podría disminuir el costo de enviar y procesar grandes volúmenes de información.
Sin embargo, las cifras deben interpretarse como resultados reportados por el propio equipo de Qwen. MarkTechPost señaló que no había evaluaciones independientes disponibles al momento de publicar la información, de modo que el rendimiento anunciado todavía requiere validación externa en escenarios de producción, especialmente cuando las consultas dependan de detalles sutiles de audio, continuidad visual o información distribuida a lo largo de un video.
Resultados anunciados y comparación con otros modelos
Qwen indicó que el promedio del modelo mejoró más de 25% frente a Qwen3.5-Omni-Plus en 29 evaluaciones. Entre los resultados destacados aparecen un aumento de 36,5 puntos en WildClawBench-MM y una mejora de 22,3 puntos en AgenticVBench, dos referencias utilizadas por el equipo para medir capacidades multimodales y orientadas a agentes.
En UniClawBench, Qwen3.8-Omni-Flash alcanzó una puntuación de 69,6, mientras que LongAudioSpan registró una ganancia de 8,3 puntos y OmniVideoBench avanzó 9,6 puntos. El conjunto de cifras busca mostrar que el modelo no solo reconoce contenido audiovisual, sino que también puede planificar acciones y utilizar herramientas para completar tareas vinculadas con ese contenido.
Las mejoras anunciadas para OmniCap-IF también fueron relevantes, con aumentos de 8,5 puntos en CSR y 14,1 puntos en ISR. El equipo de investigación afirmó que el desempeño audiovisual se acerca al de Gemini 3.8 Flash y añadió que, en audio general, Qwen3.8-Omni-Flash supera a ese modelo, aunque ambas afirmaciones corresponden a la comparación presentada por Alibaba y no a una auditoría independiente.
Qwen también resumió las ganancias agénticas en WildClawBench-MM y UniClawBench con un incremento promedio de 19,5 puntos. La diferencia entre esta cifra y la mejora promedio superior a 25% en 29 pruebas refleja que los resultados dependen del conjunto de evaluación, la métrica utilizada y la tarea concreta, por lo que no conviene convertir un único dato en una conclusión general sobre superioridad.
Precios, límites y disponibilidad de la API
QwenCloud lista un precio de USD $0,15 por cada millón de tokens de entrada y USD $0,47 por cada millón de tokens de salida. Los aciertos de caché implícita cuestan USD $0,016 por millón de tokens, una tarifa que puede resultar importante para aplicaciones que repitan instrucciones o consulten varias veces el mismo contexto audiovisual.
El equipo de investigación reportó reducciones de costos frente a Qwen3.5-Omni-Plus superiores a 98% para la entrada de audio por hora y mayores a 93% para la entrada audiovisual. Una publicación asociada al lanzamiento situó la reducción del costo de entrada de video alrededor de 89%, aunque estos porcentajes dependen del modelo de comparación, del tipo de contenido y de la forma en que cada servicio contabiliza los tokens.
La documentación de Model Studio establece que los archivos de video pueden tener hasta dos horas de duración y 2 GB por URL, mientras que los archivos de audio pueden alcanzar tres horas. El sistema admite entradas de audio en 113 idiomas y dialectos, ofrece resultados estables con video muestreado a hasta 15 cuadros por segundo y es compatible con audio espacial estéreo de dos canales y FOA de cuatro canales mediante el parámetro use_multichannel.
La disponibilidad regional comprende seis ubicaciones: Pekín, Singapur, Hong Kong, Tokio, Fráncfort y Virginia. Para los desarrolladores, la posibilidad de llamarlo mediante el SDK de OpenAI reduce la fricción inicial, porque una solicitud puede incluir una URL de video, una instrucción para identificar momentos clave y una respuesta transmitida en texto, sin exigir una arquitectura de integración completamente nueva.
Herramientas abiertas para ampliar las capacidades
Como el modelo devuelve texto y no genera directamente voz, las herramientas externas cumplen un papel central para convertir sus capacidades en productos multimedia. Qwen está liberando Qwen-MM-Plugins bajo la licencia Apache-2.0, con el objetivo de que distintos entornos de agentes incorporen funciones multimodales mediante habilidades instalables y, cuando sea necesario, un servidor MCP.
El instalador guiado es compatible con Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI. Esa lista muestra que la propuesta no depende exclusivamente de un único entorno de desarrollo, aunque la utilidad práctica seguirá condicionada por la facilidad con que cada sistema pueda enviar imágenes, fotogramas y audio al modelo principal.
Entre las demostraciones del lanzamiento aparece omni-memory, una herramienta para construir una memoria audiovisual de un video largo. También se incluye omni-video2note, que convierte un video tutorial en un PDF ilustrado, mientras que omni-chatcut cubre funciones como transformar música en un video musical, comentar películas y traducir videos preservando la voz del hablante.
El complemento core permite que el modelo principal lea imágenes locales y fotogramas de video de forma nativa. El repositorio reconoce una limitación actual: la mayoría de los entornos de agentes todavía no puede entregar audio al modelo principal de manera nativa, por lo que ese contenido debe canalizarse por la API y la experiencia completa aún depende de la integración entre herramientas.
Un lanzamiento con alcance amplio, pero todavía dependiente de servicios alojados
Qwen3.8-Omni-Flash combina en una sola propuesta varias tendencias de la inteligencia artificial aplicada: modelos multimodales, ventanas de contexto extensas, razonamiento, uso de herramientas y selección activa de evidencia. Su principal diferencia no está únicamente en aceptar cuatro tipos de entrada, sino en intentar decidir qué información necesita procesar antes de ejecutar una tarea.
Para empresas y desarrolladores, los precios anunciados pueden hacer más accesible el análisis de grabaciones largas, especialmente cuando el sistema logra reducir tokens sin perder precisión. Al mismo tiempo, los límites de tamaño, las regiones disponibles, la dependencia de una API y la ausencia de pesos abiertos restringen el control operativo de quienes necesitan desplegar el modelo dentro de su propia infraestructura.
La comparación con Gemini 3.8 Flash y las mejoras frente a Qwen3.5-Omni-Plus ofrecen una señal positiva sobre la dirección del proyecto, pero todavía no sustituyen las pruebas reproducibles de terceros. La próxima etapa será observar cómo se comporta el sistema con videos ruidosos, múltiples hablantes, acentos, información contradictoria y tareas donde un error de selección pueda ocultar precisamente el fragmento más importante.
Por ahora, el lanzamiento posiciona a Alibaba en la competencia por construir agentes capaces de percibir y actuar sobre medios audiovisuales, no solo de describirlos. Qwen3.8-Omni-Flash llega con una promesa ambiciosa de contexto masivo y procesamiento más eficiente, aunque su impacto dependerá de que los usuarios puedan verificar sus resultados y de que el ecosistema de herramientas resuelva las limitaciones de audio que persisten fuera de la API.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Beacon compra Haize Labs para evitar que sus agentes de IA fallen en empresas
Estafas
KuCoin apuesta por ISO 42001 mientras las estafas con IA golpean al mercado cripto
IA
Cloudflare advierte que los bots ya superan a los humanos en internet
AltCoins

