DeepSeek presentó un modelo multimodal experimental que incorpora lectura de imágenes y capturas de pantalla a su sistema V4-Flash. La empresa asegura que se aproxima al rendimiento de Opus-4.8 de Anthropic, aunque sus propios datos muestran una ventaja en solo tres de once pruebas y una brecha de 12 puntos en la evaluación más exigente.
***
- DeepSeek-V4-Flash-Vision-Exp ya está disponible mediante la plataforma API de la compañía y añade visión a V4-Flash.
- DeepSeek publicó el arnés Harness 0.1.1, con soporte incorporado para el modelo experimental.
- Según la tabla difundida por DeepSeek, el modelo superó a Opus-4.8 en tres de once evaluaciones, pero quedó por detrás en las otras ocho.
DeepSeek lanzó un modelo multimodal experimental que combina comprensión de texto, imágenes y capturas de pantalla con capacidades de agente. La compañía afirmó que DeepSeek-V4-Flash-Vision-Exp se acerca al rendimiento de Opus-4.8 de Anthropic en evaluaciones de agentes, aunque sus propios resultados muestran una imagen más matizada: superó al modelo estadounidense en tres de once pruebas y quedó por detrás en las ocho restantes.
La nueva variante ya está disponible en la plataforma API de DeepSeek. Su arquitectura parte de V4-Flash y añade la capacidad de interpretar elementos visuales para después ejecutar acciones relacionadas con lo que observa, una función relevante para agentes capaces de operar interfaces, analizar documentos o completar tareas digitales, informa The Next Web.
DeepSeek también publicó la versión 0.1.1 de su arnés de agente, con soporte incorporado para el modelo experimental. La compañía indicó que el sistema conserva las capacidades de texto de V4-Flash, incluidos agentes, razonamiento y conocimiento del mundo, mientras mejora su desempeño en escenarios multimodales.
Una comparación cercana, pero incompleta
La referencia elegida por DeepSeek fue Opus-4.8, un modelo de Anthropic. La comparación no incluye a Claude Opus 5, por lo que el rendimiento relativo frente a esa versión más reciente permanece sin resolver.
La tabla difundida por DeepSeek muestra una ventaja del modelo experimental en tres de once evaluaciones, pero no respalda una afirmación de superioridad generalizada. En las ocho pruebas restantes, DeepSeek-V4-Flash-Vision-Exp quedó por debajo de Opus-4.8.
Para los compradores empresariales, esa diferencia metodológica importa porque los resultados de agentes dependen del modelo, las herramientas, el arnés y la forma exacta de ejecutar cada prueba. Una comparación directa con Opus 5, utilizando las mismas condiciones, sería necesaria antes de extraer conclusiones definitivas sobre la posición competitiva de DeepSeek.
Qué muestran los once puntos de referencia
En la tabla publicada por DeepSeek, el nuevo modelo obtuvo mejores resultados que Opus-4.8 en DeepSWE, Agents’ Last Exam y ZeroBench. Las ventajas fueron de 1,3 puntos, 1,6 puntos y 1,0 punto, respectivamente, márgenes que sugieren una competencia estrecha en esos escenarios, pero no una superioridad generalizada.
En las otras ocho pruebas, DeepSeek-V4-Flash-Vision-Exp quedó por debajo. La brecha más amplia apareció en NL2Repo, donde registró 57,7 frente a 69,7 de Opus-4.8, mientras que DSBench-Hard mostró 63,6 contra 71,7.
Varias evaluaciones mostraron diferencias reducidas. Toolathlon-Verified terminó con 75,9 para DeepSeek y 76,2 para Anthropic; Chartography, con 64,3 frente a 65,0; y Terminal Bench 2.1, con 83,9 contra 85,0, cifras que mantienen abierta la discusión sobre qué modelo ofrece mejores resultados en tareas concretas.
AutomationBench ofrece una señal menos favorable para ambos competidores. Los tres modelos incluidos en la tabla se ubicaron en la mitad de los veinte, con puntuaciones de 25,7, 25,1 y 27,2, lo que sugiere que los agentes actuales todavía tienen dificultades importantes en esa evaluación, independientemente de la ventaja puntual de un sistema sobre otro.
Causas de movimientos recientes
El lanzamiento del modelo y su disponibilidad en la API son catalizadores confirmados por DeepSeek, al igual que la publicación de Harness 0.1.1 con soporte para la nueva variante. No obstante, la evidencia disponible no permite atribuir a este anuncio un movimiento específico de precios o de mercado.
La mejora de capacidades multimodales y el bajo costo pueden considerarse factores plausibles para aumentar el interés de desarrolladores y empresas, pero no constituyen por sí mismos una causa confirmada de adopción o de cambios en el mercado.
El efecto de añadir visión
En ApexBench, el modelo con visión alcanzó 36,5 frente a 26,2 del sistema basado solo en texto, mientras que en Agents’ Last Exam registró 27,3 contra 25,2. La empresa presenta estos resultados como una mejora de las capacidades de agente.
La nota al pie de la tabla introduce una salvedad esencial: en esas dos evaluaciones, V4-Flash ignoró los elementos multimodales incluidos en las pruebas. El modelo anterior fue evaluado sobre tareas que contenían imágenes que no podía ver, mientras que la nueva variante sí tuvo acceso a esa información visual.
Ese detalle no invalida los resultados del modelo con visión, pero cambia su interpretación. Parte del avance mide el efecto de otorgar vista a un sistema que antes enfrentaba imágenes como información ausente, por lo que la magnitud del salto no equivale necesariamente a una mejora uniforme en todas las capacidades de razonamiento o ejecución.
La variante de visión también mejora en texto
En los siete puntos de referencia textuales, la variante con visión superó al modelo de texto en seis. Las mejoras más grandes aparecieron en Toolathlon-Verified, con 5,6 puntos adicionales; DeepSWE, con 4,9; y DSBench-Hard, con 4,0.
El comportamiento no fue uniforme: en Cybergym el modelo con visión obtuvo 75,3 frente a 76,7 de V4-Flash, una caída de 1,4 puntos en una evaluación relacionada con seguridad.
Todos esos números proceden de la evaluación interna de DeepSeek. La compañía indicó que probó sus propios modelos mediante su propio arnés, en modo mínimo, con temperatura de 1,0 y un valor top_p de 0,95.
Los puntos de referencia proporcionados por los fabricantes pueden funcionar como una señal inicial, pero no sustituyen una evaluación independiente. Las diferencias de infraestructura, selección de tareas, herramientas disponibles y configuración pueden alterar el desempeño.
El precio convierte el desempeño en argumento comercial
La relevancia del lanzamiento también depende de los costos de operación. Según comparaciones de precios disponibles, V4-Flash se ofrece por menos que los modelos Opus de Anthropic, aunque las tarifas dependen de la variante, el momento y las condiciones de uso. Por ello, no debe tratarse una cifra aislada como un precio universal o permanente.
Una diferencia de costos puede cambiar la decisión de empresas que procesan grandes volúmenes de solicitudes, incluso cuando el modelo más económico pierde por uno o dos puntos en algunas evaluaciones. Desde esa perspectiva, el desempeño cercano en varias pruebas puede convertirse en una ventaja de adopción si las organizaciones priorizan el costo total por tarea.
La desventaja de 12 puntos en NL2Repo plantea, sin embargo, un problema para los clientes empresariales interesados en agentes de programación. El trabajo sobre repositorios a escala es uno de los usos por los que las compañías están comprando estos sistemas, de modo que el ahorro no necesariamente compensa una menor capacidad en tareas centrales para sus flujos de desarrollo.
Qué puede concluirse por ahora
La afirmación de que el modelo se acerca a Opus-4.8 resulta compatible con algunos de los resultados publicados, pero no describe una victoria global sobre Anthropic. La tabla muestra tres victorias en once evaluaciones y ocho derrotas, incluida una brecha de 12 puntos en NL2Repo.
La evidencia disponible describe un modelo multimodal experimental que combina mejoras en tareas visuales, un costo potencialmente atractivo y resultados competitivos en ciertos benchmarks, pero también límites claros. Además, los datos citados proceden de una comparación difundida por DeepSeek y requieren validación independiente.
El próximo contraste decisivo sería ejecutar V4-Flash-Vision-Exp contra Opus 5 con el mismo arnés y bajo condiciones comparables. Sin esa medición, no es posible saber si la cercanía observada frente a Opus-4.8 se mantiene ante la versión más nueva de Anthropic.
Por ahora, el lanzamiento fortalece la oferta de DeepSeek en agentes multimodales y muestra el valor práctico de añadir visión a un modelo de texto. La tabla, leída completa y no solo a través de sus tres victorias, describe una competencia intensa en la que el precio pesa tanto como el rendimiento.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
YouTube sube el precio de cuentas Premium en Europa y exige a usuarios aceptar el cambio
Estados Unidos
Nueva York supera a San Francisco como epicentro del talento tecnológico, impulsada por la inteligencia artificial
Bancos y Pagos
Agentes IA necesitarán sus propias cuentas bancarias, anticipa CEO de Anchorage Digital
Adopción