Por Canuto  

Una evaluación de Vals AI encontró que los equipos de agentes pueden costar varias veces más que un agente individual y, en la mayoría de las pruebas, apenas elevar la calidad. Los resultados también apuntan a un límite práctico: coordinar más sistemas puede acelerar algunas tareas, pero no necesariamente mejora lo que producen.
***

  • En cuatro comparaciones de Vals AI, solo una mostró una mejora estadísticamente significativa: GPT-6 Sol con razonamiento medio, que avanzó 7,3 puntos.
  • Los equipos costaron entre 1,8 y 5,1 veces más que los agentes individuales, sin ventaja clara con el máximo esfuerzo de razonamiento.
  • Noam Brown señaló que varios agentes pueden ganar velocidad, pero la investigación web y las matemáticas se paralelizan mejor que tareas creativas como escribir una novela.


Equipos de agentes de IA cuestan más y apenas mejoran la calidad, según una investigación

Los sistemas de inteligencia artificial que reúnen varios agentes para resolver una tarea no siempre justifican el gasto adicional. Una evaluación de Vals AI, reseñada por The Decoder, comparó agentes individuales con equipos en el Vibe Code Bench y encontró que estos últimos costaban entre 1,8 y 5,1 veces más, mientras las mejoras de calidad resultaban limitadas en la mayoría de las configuraciones.

El hallazgo no significa que la coordinación entre agentes carezca de utilidad en todos los escenarios. Sí pone en cuestión la idea de que sumar modelos, por sí solo, produzca mejores respuestas: en las pruebas revisadas, el mayor costo no se tradujo de manera consistente en una mejora estadísticamente significativa, sobre todo cuando los modelos ya trabajaban con el máximo esfuerzo de razonamiento.

El costo creció más que las puntuaciones

Vals AI probó GPT-6 Sol y Claude Opus 5.5, tanto de forma individual como en equipos, con dos niveles de razonamiento: medio y máximo esfuerzo. La comparación buscaba observar no solo qué configuración alcanzaba una mejor puntuación en el Vibe Code Bench, sino también cuánto costaba producir ese resultado, un contraste central para evaluar si el trabajo multiagente ofrece valor práctico.

De las cuatro comparaciones entre equipos y agentes individuales, solo una arrojó una mejora estadísticamente significativa. Ocurrió con GPT-6 Sol en el nivel de razonamiento medio: la configuración en equipo superó a la individual por 7,3 puntos, mientras las otras pruebas no ofrecieron una diferencia comparable que sostuviera una ventaja general de los equipos.

Con el máximo esfuerzo de razonamiento, los equipos no dieron una ventaja real ni a GPT-6 Sol ni a Claude Opus 5.5, de acuerdo con los resultados de la evaluación. Esa diferencia entre niveles sugiere que aumentar la capacidad de cómputo de un agente puede reducir el margen para que la coordinación aporte algo adicional, aunque la prueba no permite concluir que ese patrón se repita en todas las tareas o modelos.

La brecha económica fue más contundente que la de rendimiento: los equipos costaron entre 1,8 y 5,1 veces más que los agentes individuales. Por eso, una puntuación ligeramente superior no basta para demostrar que una arquitectura multiagente sea más eficiente; el beneficio debe valorarse frente al gasto adicional y a la importancia concreta de cada mejora para el usuario o el desarrollador.

Más agentes pueden acelerar una tarea sin mejorar su resultado

La investigación también recoge pruebas de Anthropic con Claude Opus 5.5 en una tarea de base de conocimiento y otra de demostración de teoremas Lean. En la primera, la puntuación pasó de 0,53 con un agente a 0,70 con diez, luego a 0,71 con treinta y finalmente a 0,74 con cien; el avance continuó, pero se hizo mucho menor al ampliar el equipo.

En la demostración de teoremas Lean, Opus 5.5 obtuvo 0,39 con un agente y 0,66 con diez, mantuvo 0,66 con treinta y llegó a 0,68 con cien. La mayor parte de la ganancia se produjo al pasar de uno a diez agentes, mientras que sumar más participantes después de ese punto generó cambios modestos, según los datos citados en el reporte.

Anthropic observó que los equipos numerosos podían alcanzar un nivel de rendimiento determinado con mayor rapidez, pero el escalamiento no elevó las puntuaciones en la misma proporción. En las mediciones descritas, pasar de diez a cien agentes produjo solo avances ligeros después de 24 horas, y pruebas separadas de ProgramBench vincularon las ganancias de velocidad con un consumo mayor de tokens.

Fable 5.1 mostró mejoras más marcadas que Opus 5.5 en la tarea de demostración de teoremas Lean al superar los diez agentes, aunque sus puntuaciones quedaron por debajo de las de Opus 5.5 en todas las pruebas mencionadas. En la tarea de base de conocimiento, además, la puntuación de Fable descendió ligeramente cuando el equipo creció de treinta a cien agentes, una señal de que ampliar la escala no garantiza un progreso continuo.

La utilidad depende de la tarea y del costo de coordinación

Noam Brown, investigador de OpenAI, sostuvo en el Dwarkesh Podcast que los sistemas multiagente compran principalmente velocidad, no necesariamente una calidad superior. Según su explicación, cuatro agentes resolvieron tareas en la mitad del tiempo, pero duplicaron el costo; con dieciséis agentes se mantuvo una relación similar, aunque la eficiencia empeoró ligeramente.

Brown también señaló que la posibilidad de repartir el trabajo cambia mucho según la actividad. La investigación web y las matemáticas pueden dividirse entre agentes con mayor facilidad, mientras que escribir una novela no ofrece la misma estructura paralelizable: lanzar diez mil agentes a esa tarea sería tan inútil, planteó, como asignarla a diez mil personas.

El investigador reconoció que llevar los equipos a cifras muy grandes sigue siendo un terreno poco explorado, en buena medida porque los costos se vuelven demasiado altos. Esta limitación no es solamente financiera: cuanto más grande es el equipo, más importante resulta coordinar sus aportes, evitar trabajo duplicado y combinar respuestas sin perder tiempo ni recursos en el propio proceso de colaboración.

Eric Provencher, desarrollador de OpenAI, también advirtió recientemente contra el uso de enjambres de agentes por el riesgo de que la coordinación se rompa y convierta el gasto en dinero desperdiciado. Describió ese costo organizativo como un impuesto de coordinación, una forma de resumir el esfuerzo que puede absorberse en dirigir a los agentes en lugar de avanzar en la tarea principal.

El desafío es justificar cada agente adicional

En conjunto, las pruebas plantean una distinción importante para quienes diseñan herramientas de IA: producir más rápido no equivale automáticamente a producir mejor, y ninguna de esas ventajas garantiza que el costo por resultado sea razonable. En las comparaciones de Vals AI, la mejora estadísticamente significativa apareció en una sola configuración, mientras que las opciones de máximo razonamiento no obtuvieron un beneficio real por trabajar en equipo.

Los datos de Anthropic agregan otro matiz: los equipos sí pueden subir las puntuaciones en ciertas tareas, pero los avances tienden a reducirse cuando el número de agentes sigue aumentando. La evolución de Opus 5.5 en las pruebas de base de conocimiento y Lean, junto con el retroceso leve de Fable 5.1 al pasar de treinta a cien agentes en una de ellas, muestra que los resultados no escalan de manera uniforme.

Para las empresas y los usuarios, la decisión de recurrir a varios agentes debería depender de la tarea, del tiempo que se busca ahorrar y del valor de una eventual mejora de calidad. Una actividad fácil de dividir puede aprovechar el procesamiento paralelo; una labor creativa o difícil de coordinar podría absorber recursos sin ofrecer un resultado proporcionalmente mejor, como advierten Brown y Provencher.

La investigación no descarta que futuros sistemas multiagente encuentren formas más eficientes de repartirse el trabajo ni establece que un solo agente siempre sea la opción correcta. Su conclusión más acotada es que, en las pruebas presentadas, pagar más por una estructura de equipo rara vez produjo una mejora de calidad equivalente, por lo que sumar agentes requiere una justificación concreta y no solo la expectativa de que más sistemas generen mejores respuestas.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín