DeepSeek V4 Flash 0731 alcanzó 50 puntos en el Índice de Inteligencia de Artificial Analysis, diez más que su antecesor. El modelo iguala a Gemini 3.6 Flash, queda a un punto de GPT-5.6 Luna y ofrece un costo por tarea aproximadamente 60% menor.
***
- DeepSeek V4 Flash 0731 obtuvo 50 puntos en el Índice de Inteligencia, frente a 40 de la versión anterior.
- El modelo alcanzó 1.559 Elo en GDPval-AA v2 y mejoró sus resultados en Terminal-Bench 2.1 y τ³-Bench Banking.
- DeepSeek mantiene una ventana de contexto de 1 millón de tokens, 284.000 millones de parámetros y un descuento de 98% para caché.
DeepSeek V4 Flash 0731 alcanza 50 puntos y desafía a los modelos líderes de IA
DeepSeek V4 Flash 0731 obtuvo 50 puntos en el Índice de Inteligencia de Artificial Analysis, diez más que la versión anterior.
- DeepSeek V4 Flash 0731 obtuvo 50 puntos en el Índice de Inteligencia, frente a 40 de la versión anterior.
- El modelo alcanzó 1.559 Elo en GDPval-AA v2 y mejoró sus resultados en Terminal-Bench 2.1 y τ³-Bench Banking.
- DeepSeek mantiene una ventana de contexto de 1 millón de tokens, 284.000 millones de parámetros y un descuento de 98% para caché.
Un salto de diez puntos en inteligencia
DeepSeek V4 Flash 0731 alcanzó una puntuación de 50 en el Índice de Inteligencia de Artificial Analysis. El resultado representa un avance de diez puntos frente a DeepSeek V4 Flash, que había registrado 40.
Con esta puntuación, el nuevo modelo quedó a un punto de GPT-5.6 Luna en su configuración máxima. También igualó el resultado atribuido a Gemini 3.6 Flash y se situó un punto detrás de Muse Spark 1.1 en su configuración xhigh.
El desempeño coloca a DeepSeek V4 Flash 0731 dentro de la frontera de Pareto que relaciona inteligencia y costo por tarea. En otras palabras, el modelo combina un resultado competitivo con un gasto operativo menor frente a varias alternativas.
La comparación con los modelos de pesos abiertos muestra una brecha todavía existente. DeepSeek V4 Flash 0731 se encuentra siete puntos por debajo de Kimi K3 en su configuración máxima, que establece una puntuación de 57.
El modelo también quedó cerca de GLM-5.2 en su configuración máxima, situado a un punto de su resultado de 51. Artificial Analysis presentó estas mediciones como parte de su desglose del Índice de Inteligencia v4.1.
La organización indicó que espera la liberación de los pesos completos durante las próximas semanas. Esa publicación permitiría comparar el modelo fuera de la API de primera parte de DeepSeek y facilitaría su evaluación por parte de desarrolladores independientes.
Más rendimiento agéntico y menos alucinaciones
Una de las principales mejoras apareció en GDPval-AA v2, una evaluación centrada en tareas de trabajo del mundo real. DeepSeek V4 Flash 0731 alcanzó una calificación Elo de 1.559, frente a 1.189 de su predecesor.
De acuerdo con Artificial Analysis, esa puntuación convertiría al modelo en el segundo sistema de pesos abiertos con mejor resultado cuando se publiquen sus parámetros. Solo Kimi K3, con 1.687 Elo en su configuración máxima, quedaría por encima.
El nuevo modelo también mejoró en Terminal-Bench 2.1. Su resultado subió 17 puntos, hasta alcanzar 79%, una medición asociada con tareas ejecutadas mediante terminales y flujos de trabajo técnicos.
En τ³-Bench Banking, la mejora fue de ocho puntos y llevó el resultado a 31%. Este avance amplía el desempeño de DeepSeek en tareas especializadas, aunque la cifra no implica que el modelo sea infalible en servicios financieros.
El Índice de AA-Omniscience pasó de -23 a -16, una mejora de siete puntos. La organización explicó que el cambio provino completamente de una menor tasa de alucinaciones, mientras la precisión general permaneció estable.
La tasa de alucinación se ubicó en 84%, once puntos menos que en el modelo anterior, aunque la fuente también describe la reducción como de 12 puntos. La precisión general se mantuvo en 37%, un resultado consistente con el hecho de que el tamaño del modelo no cambió.
Artificial Analysis comparó esa tasa de alucinación con la de GPT-5.6 Terra en su configuración máxima, que registra 85%, y con Mistral Medium 3.5, que alcanza 82%. La comparación sugiere una posición competitiva, pero no elimina la necesidad de verificar las respuestas.
Arquitectura, precios y eficiencia operativa
DeepSeek V4 Flash 0731 conserva la arquitectura y los precios del DeepSeek V4 Flash anterior. Su ventana de contexto permanece en 1 millón de tokens, una capacidad orientada a procesar grandes volúmenes de información en una sola interacción.
El modelo mantiene 284.000 millones de parámetros totales y 13.000 millones de parámetros activos durante la inferencia. La arquitectura no incorpora un aumento de tamaño respecto a la generación precedente.
DeepSeek V4 Flash 0731 acepta entradas y produce salidas exclusivamente en formato de texto. El acceso está disponible mediante la API de primera parte de DeepSeek, según los detalles publicados sobre el modelo.
El precio informado es de USD $0,14 por cada millón de tokens de entrada y de USD $0,28 por cada millón de tokens de salida. Esas tarifas no cambiaron frente a DeepSeek V4 Flash.
El costo por cada millón de tokens asociados con un hit de caché es de USD $0,0028. Esto equivale a un descuento aproximado de 98%, una reducción más agresiva que el descuento de 90% ofrecido por la mayoría de la industria, según la información disponible.
El precio por tarea de DeepSeek V4 Flash 0731 en la API de primera parte resulta aproximadamente 60% inferior al de GPT-5.6 Luna en su configuración máxima. La comparación adquiere relevancia porque ambos modelos muestran niveles de inteligencia similares en el índice.
OpenAI redujo 80% el precio de GPT-5.6 Luna el mismo día de la comparación. Aun después de ese ajuste, DeepSeek V4 Flash 0731 conserva la ventaja de costo por tarea señalada por Artificial Analysis.
La eficiencia también se reflejó en el consumo de tokens de salida durante la evaluación. El modelo utilizó aproximadamente 206 millones de tokens, frente a cerca de 234 millones empleados por DeepSeek V4 Flash.
Mejoras distribuidas en las evaluaciones
DeepSeek V4 Flash 0731 mejoró frente a su predecesor en todas las evaluaciones incluidas en el Índice de Inteligencia. El resultado no depende de una sola prueba, sino de avances distribuidos en diferentes áreas.
En CritPt, la puntuación aumentó nueve puntos y llegó a 17%. Esta evaluación forma parte del conjunto de mediciones utilizado para construir el índice comparativo de Artificial Analysis.
SciCode registró un incremento de cinco puntos, hasta 50%. El resultado refleja una mejora en tareas científicas y de programación, aunque la fuente no atribuye el cambio a una modificación específica de la arquitectura.
El Último Examen de la Humanidad también avanzó cinco puntos y alcanzó 37%. La cifra incorpora otra dimensión de razonamiento dentro del conjunto de pruebas usado para valorar la inteligencia del modelo.
AA-LCR subió tres puntos, hasta 66%, mientras GPQA Diamond aumentó un punto y llegó a 91%. Estas variaciones completan el cuadro de mejoras registrado por la nueva versión.
El desempeño general coloca a DeepSeek V4 Flash 0731 junto a modelos recientes de compañías y laboratorios distintos. Su combinación de rendimiento, contexto extenso y precio reducido puede aumentar la presión competitiva en el mercado de APIs de inteligencia artificial.
Sin embargo, la futura publicación de los pesos será un paso decisivo para evaluar su utilidad en despliegues propios. Hasta entonces, los resultados descritos corresponden al acceso mediante la API de primera parte de DeepSeek.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Google Earth permite crear zonas de guerra con IA y abre un nuevo frente contra la desinformación
Empresas
GM prepara su propio asistente de IA para transformar la experiencia del auto
Empresas
Apple cae 9% y Amazon sube 14% tras resultados que dividen al mercado
IA