Por Canuto  

Artificial Analysis actualizó su Intelligence Index a la versión 4.2 tras las dudas sobre la puntuación inicial de GPT-6 Astra. La nueva versión coloca al modelo de OpenAI en segundo lugar, incorpora pruebas de conocimiento y documentos, y aumenta el peso de los datos privados para evaluar mejor las capacidades de los modelos.
***

  • Claude Fable 5.1 lidera la versión 4.2 del índice, seguida por GPT-6 Astra.
  • La nueva edición incorpora evaluaciones como AA-Briefcase y GDPval-AA v2, con tareas más complejas y realistas.
  • Los conjuntos de prueba privados representan ahora 40% de la ponderación del Intelligence Index.


Artificial Analysis actualizó su Intelligence Index a la versión 4.2 después de que usuarios y evaluadores cuestionaran que la medición inicial de GPT-6 Astra no reflejara el desempeño observado en el modelo. La revisión coloca a Astra en el segundo lugar, detrás de Claude Fable 5.1, según la publicación de la nueva edición. El cambio llega en medio de resultados dispares entre distintas evaluaciones de modelos de inteligencia artificial.

Un ajuste provocado por la carrera de los modelos

La discusión comenzó porque diferentes mediciones situaron a GPT-6 Astra en posiciones destacadas, mientras que versiones anteriores del Intelligence Index ofrecían una lectura menos favorable. Epoch AI ubicó a Astra en el primer lugar entre 267 modelos, con 169 puntos obtenidos a partir de más de 50 benchmarks. Esa diferencia entre resultados externos y clasificaciones compuestas alimentó el debate sobre la capacidad de cada sistema para capturar avances rápidos en los modelos frontera.

Otra señal de esa variación apareció en ARC-AGI-3, una evaluación orientada a medir capacidades de razonamiento más difíciles y generalizables. La organización ARC Prize informó una puntuación de 62,7% para GPT-6 Astra en una configuración semiprivada y con su harness estándar, con un coste indicado de 26.000 dólares. Otros resultados difundidos públicamente utilizaron configuraciones distintas, por lo que no deben compararse como si fueran una única medición definitiva.

En la clasificación renovada, Claude Fable 5.1 de Anthropic ocupa el primer puesto y GPT-6 Astra aparece en segundo lugar. El orden mejora la posición pública del modelo de OpenAI frente a la lectura anterior, aunque no convierte a Astra en líder absoluto. Las diferencias entre índices muestran que el resultado depende de los benchmarks incluidos, de su ponderación y de las condiciones utilizadas para ejecutar cada prueba.

Artificial Analysis presentó la versión 4.2 como una actualización con tareas más complejas y realistas, además de un mayor uso de conjuntos de prueba privados. La revisión busca que el índice siga siendo útil mientras los modelos avanzan y los resultados de algunas evaluaciones públicas se vuelven menos capaces de distinguir entre sistemas de alto rendimiento.

Más pruebas y mayor peso para los datos privados

La versión 4.2 incorpora AA-Briefcase, una evaluación de tipo agente que analiza miles de páginas de documentos, y GDPval-AA v2, entre otros benchmarks. Estas pruebas amplían la evaluación más allá de preguntas académicas o ejercicios aislados, con tareas que se acercan al trabajo de investigación, síntesis, análisis documental y uso de herramientas.

El índice también incluye evaluaciones relacionadas con banca, programación, ciencia y razonamiento. La metodología publicada por Artificial Analysis describe la versión 4.2 como una métrica compuesta que reúne diez evaluaciones para ofrecer una medida general de las capacidades de los modelos.

Los datos de prueba privados representan ahora 40% de la ponderación total. La decisión busca reducir el riesgo de que los modelos optimicen sus resultados sobre preguntas públicas que pudieron aparecer en sus datos de entrenamiento o que son conocidas por los desarrolladores. También pretende ofrecer una señal más cercana al desempeño sobre tareas nuevas, aunque ningún índice por sí solo puede medir todas las capacidades de un sistema.

El cambio de metodología tiene consecuencias para la interpretación de la tabla. Un modelo puede subir o bajar posiciones porque mejoró su desempeño, pero también porque cambió la selección de pruebas, la ponderación o el sistema de calificación. Por esa razón, las posiciones de Claude Fable 5.1 y GPT-6 Astra deben leerse junto con los resultados individuales y las condiciones de cada benchmark.

Qué significa el cambio para los rankings de IA

Los rankings de modelos cumplen una función parecida a la de los índices en otros mercados tecnológicos: condensan muchos datos en una referencia rápida, pero dependen de la metodología utilizada. Una modificación en los benchmarks, en su ponderación o en el sistema de calificación puede cambiar la posición de un modelo sin que exista una transformación equivalente en cada una de sus capacidades.

La actualización también ilustra la tensión entre estabilidad y actualidad. Si un índice cambia después de cada lanzamiento, sus cifras pueden resultar difíciles de comparar con el pasado; si tarda demasiado, corre el riesgo de quedarse atrás frente a una industria que avanza con rapidez. Artificial Analysis optó en esta ocasión por una revisión con nuevas pruebas y una mayor proporción de datos privados.

Para OpenAI, la nueva clasificación mejora la posición pública de GPT-6 Astra, aunque no lo coloca en el primer lugar general. Anthropic conserva el liderazgo con Claude Fable 5.1, mientras que las evaluaciones externas ofrecen resultados diferentes según el conjunto de pruebas y la configuración empleada. La lectura más prudente es que el liderazgo depende de la tarea, el coste, la eficiencia y el método de evaluación.

El próximo punto de atención será la evolución de la metodología de Artificial Analysis y de los propios benchmarks. A medida que los modelos superen pruebas públicas, será necesario sustituirlas o complementarlas con tareas privadas y escenarios más realistas. Por ahora, la versión 4.2 ofrece una respuesta concreta a las dudas sobre el ranking: más datos privados, nuevos escenarios de trabajo y una posición de segundo lugar para GPT-6 Astra detrás de Claude Fable 5.1.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín