Por Canuto  

El costo de alcanzar una puntuación fija en pruebas de inteligencia artificial se desploma, según Epoch AI, pero esa caída no equivale por sí sola a una mejora idéntica en eficiencia: modelos más capaces también pueden consumir más cómputo por respuesta.
***

  • Epoch AI calcula que los precios para igualar un rendimiento específico caen, en promedio, cerca de 47% por trimestre, o unas 13 veces al año.
  • Un análisis del MIT atribuye parte de la baja al hardware y a la competencia, y estima en torno a 3 veces anuales la mejora algorítmica.
  • Los modelos de razonamiento pueden ofrecer mejores resultados con más cómputo por tarea, por lo que el precio por token no basta para comparar opciones.


La IA se abarata a toda velocidad, pero responder mejor aún puede costar más

El precio de alcanzar un nivel de rendimiento determinado en varias pruebas de inteligencia artificial cayó con rapidez desde 2023, aunque esa reducción no significa que todas las consultas sean más baratas.

Epoch AI calcula que el costo de igualar una puntuación fija disminuye cerca de 47% por trimestre en promedio, equivalente a unas 13 veces al año. Un análisis del MIT ofrece una lectura más acotada: tras separar factores como el hardware y la competencia, estima que la eficiencia algorítmica mejora alrededor de 3 veces al año.

Igualar el rendimiento anterior cuesta mucho menos

La diferencia entre abaratar una capacidad ya alcanzada y ejecutar el modelo más avanzado es central para interpretar estas cifras. Epoch AI, organización de investigación que sigue las tendencias de la inteligencia artificial, mide cuánto cobran los proveedores por lograr un resultado determinado en distintos benchmarks, no cuánto cuesta toda forma de uso ni cuánto aumenta la productividad de una empresa.

Como ejemplo, la organización compara el desempeño de o3, de OpenAI, en GPQA Diamond, una prueba de ciencias de nivel doctoral. A comienzos de 2025, o3 obtuvo 75% de precisión y el costo estimado fue de USD $0,30 por pregunta; 18 meses después, un modelo de la familia GPT-5.6 alcanzó esa misma puntuación por 0,04 centavos de dólar.

Epoch AI calcula que igualar ese resultado cuesta ahora 1/725 del precio original. Para ilustrar la velocidad de la reducción, plantea una comparación hipotética: si los automóviles se abarataran al mismo ritmo, un vehículo de EUR 50.000 costaría menos de EUR 70, aunque la analogía no describe un cambio observado en el mercado automotor.

El análisis añade que OpenAI lanzó los modelos GPT-6 Sol y Luna pocos días antes de la publicación de la nota, y plantea que la brecha de costos podría haberse ampliado aún más. Epoch AI basa su medición en cinco benchmarks de matemáticas, ciencias y acertijos de lógica, y advierte que se trata de una muestra limitada, con resultados razonables pero aproximados según los datos disponibles.

El hardware y la competencia también empujan los precios a la baja

Un equipo del MIT, encabezado por Hans Gundlach, estudió datos de precios de Artificial Analysis correspondientes al período entre abril de 2024 y noviembre de 2025. Su análisis abarca más modelos por prueba que estudios anteriores, pero llega a cifras menos pronunciadas que las de Epoch AI, en parte porque los sistemas recientes pueden dedicar más cómputo a cada problema.

Ese gasto adicional importa porque los precios por token no describen el costo completo de una respuesta correcta. Los tokens son unidades de texto que los proveedores usan para cobrar, pero un modelo de razonamiento puede generar o procesar más de esas unidades al resolver tareas difíciles, de modo que una tarifa menor por token no garantiza una consulta más económica.

Para desglosar la reducción, los investigadores del MIT separan la eficiencia algorítmica de los efectos del hardware más barato y la presión competitiva sobre los precios. También comparan por separado modelos abiertos para controlar la influencia de la competencia y estimar qué parte del descenso puede atribuirse a mejoras en los algoritmos.

Con ese método, la eficiencia algorítmica por sí sola mejora cerca de 3 veces al año, según el estudio. La cifra de 13 veces que calcula Epoch AI incorpora también el abaratamiento del hardware y la competencia comercial; por eso ambas estimaciones no necesariamente se contradicen, sino que responden a preguntas distintas sobre la caída de precios.

Más puntos en un benchmark no siempre significan más eficiencia

El análisis del MIT advierte que algunos avances en las puntuaciones provienen de asignar más potencia de procesamiento a cada pregunta. Un modelo que supera a su antecesor en GPQA Diamond puede parecer más eficiente a primera vista, pero el equipo estima que una parte importante de la mejora se explica por el aumento del cómputo utilizado para responder.

En ese escenario, el sistema obtiene una puntuación superior, aunque también cuesta más ejecutarlo. Los benchmarks de programación y matemáticas muestran un patrón parecido, si bien menos marcado: la puntuación final puede combinar mejoras en entrenamiento, datos y arquitectura con un mayor esfuerzo de cómputo durante la respuesta.

Por eso, una sola nota de evaluación no permite distinguir cuánto progreso procede de un algoritmo más eficiente y cuánto de gastar más recursos. Epoch AI también considera el riesgo de que las empresas optimicen sus modelos para pruebas conocidas, una práctica que puede elevar resultados sin demostrar una mejora equivalente en situaciones cotidianas.

Para reducir ese posible sesgo, Epoch AI incluyó Mystery Game Puzzles, una prueba basada en un juego que se ha mantenido en secreto. Los costos descienden más lentamente en ese benchmark, un resultado compatible con la hipótesis de optimización excesiva para pruebas públicas, aunque también podría explicarse por el formato de la tarea o por ruido en los datos.

Elegir un modelo exige mirar más allá del precio

Las tendencias generales sirven para mostrar que el acceso a capacidades ya conocidas puede abaratarse, pero no indican por sí solas qué modelo conviene para una tarea concreta. Un precio bajo puede venir acompañado de una latencia alta, una limitación que perjudicaría, por ejemplo, a un chatbot que necesita responder en tiempo real.

La velocidad también puede ser decisiva para flujos de trabajo automatizados, mientras que la calidad importa cuando un error obliga a repetir una consulta o a corregir el resultado. En ciertos casos, un modelo más costoso podría reducir el gasto total si acierta con mayor frecuencia y evita reintentos, aunque la comparación por precio de token no refleje esa diferencia.

Herramientas de comparación como Artificial Analysis ordenan modelos según varios criterios, entre ellos calidad, precio, latencia, tamaño de la ventana de contexto y velocidad de salida. Esas variables muestran por qué el modelo más barato rara vez gana en todas las dimensiones y por qué el costo operativo depende del uso, además de la tarifa publicada.

La conclusión práctica es que la caída del precio para igualar capacidades previas no equivale a una reducción automática del costo de cada consulta ni a una mejora uniforme de productividad. Para comparar opciones, usuarios y empresas deben considerar el rendimiento requerido y los recursos que consume cada respuesta, además del precio por token.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín