Kimi K3, un modelo abierto de inteligencia artificial, mostró un desempeño cercano al de Fable 5 en unas 1.030 tareas agenciales. Un análisis de Fireworks sostiene que el enrutamiento entre ambos alcanzó 93% de precisión y redujo los costos hasta 50 veces en ciertos trabajos.
***
- Kimi K3 y Fable 5 quedaron a pocos puntos de distancia en varias categorías, aunque cada modelo destacó en áreas diferentes.
- El enrutamiento oracle seleccionó a Kimi K3 para entre 72% y 96% de las tareas evaluadas.
- Fireworks plantea que los modelos abiertos y especializados podrían desplazar el uso exclusivo de un único proveedor.
Un análisis publicado por Fireworks el 21 de julio de 2026 comparó a Kimi K3, un modelo abierto, con Fable 5, un sistema cerrado de calidad fronteriza. La evaluación abarcó aproximadamente 1.030 tareas agenciales ejecutadas mediante un mismo arnés.
El estudio encontró que ambos modelos ofrecieron resultados cercanos en términos generales. Sin embargo, sus fortalezas no fueron idénticas, un factor que permitió mejorar el rendimiento al enviar cada tarea al sistema más adecuado.
La conclusión central apunta a un cambio en la forma de utilizar modelos de inteligencia artificial. En lugar de escoger una única herramienta para toda la carga de trabajo, Fireworks propone combinar modelos mediante un sistema de enrutamiento.
Según la empresa, la combinación de Kimi K3 y Fable 5 logró una precisión de 93%. En bucles agenciales largos, el ahorro llegó hasta aproximadamente 50 veces frente al uso exclusivo de Fable 5.
El resultado refuerza la importancia de medir el costo por tarea y no solamente la capacidad máxima de un modelo. Una solución ligeramente más lenta, pero mucho más económica, puede resultar más útil para agentes que operan a escala.
Una evaluación en cinco familias de tareas
Fireworks ejecutó ambos modelos en cinco familias de referencias diseñadas para representar distintos tipos de trabajo. La muestra incluyó correcciones de errores, operaciones prolongadas en terminal, problemas algorítmicos, programación en varios lenguajes y tareas legales.
La categoría SWE reunió 460 tareas de corrección de errores en repositorios reales, con un formato similar al de SWE-bench. En esta prueba, Kimi K3 alcanzó una tasa de resolución de 92,4%, mientras Fable 5 llegó a 92,6%.
El conjunto de terminal incluyó 89 operaciones agenciales largas relacionadas con seguridad, criptografía, ingeniería inversa y administración de sistemas. También se evaluaron 100 problemas algorítmicos inspirados en LeetCode y AtCoder.
La prueba multi-lenguaje abarcó 225 tareas de implementación en seis lenguajes de programación. Por su parte, la referencia legal incluyó 120 tareas calificadas por abogados, con el objetivo de medir el comportamiento de los agentes en un contexto especializado.
Los resultados generales mostraron diferencias reducidas entre ambos sistemas. Fable 5 tomó una ligera ventaja en la amplitud de lenguajes de programación, mientras Kimi K3 mostró fortalezas más marcadas en terminal y en determinadas tareas legales.
Kimi K3 y Fable 5 tienen fortalezas distintas
La comparación de Fireworks no presentó a un modelo como ganador absoluto. El análisis por dominios reveló que Kimi K3 fue más sólido en matemáticas simbólicas y herramientas de desarrollo dentro de la categoría SWE.
Fable 5, en cambio, superó a Kimi K3 en trabajos vinculados con visualización web y datos. Esta diferencia explica por qué los promedios generales pueden ocultar ventajas relevantes cuando se examina una carga de trabajo concreta.
El patrón también apareció en las tareas multi-lenguaje. Fable 5 mostró mayor amplitud en Java, Python y C++, mientras Kimi K3 se mantuvo a la par en JavaScript y Rust.
La categoría de terminal ofreció uno de los contrastes más claros. Kimi K3 resolvió tareas que Fable 5 no logró completar, entre ellas un hash 7z, criptoanálisis FEAL, búsqueda de secretos filtrados, una vulnerabilidad activa y trabajos asíncronos en fuga.
De las 89 tareas de terminal, Kimi K3 obtuvo 11 victorias individuales y Fable 5 consiguió siete. El modelo abierto se impuso especialmente en los conjuntos relacionados con seguridad y criptografía.
La ventaja de costos puede cambiar la decisión
Aunque la calidad quedó cerca en el nivel agregado, la diferencia de precios fue mucho más amplia. Fireworks atribuyó esta brecha a los precios por token, el almacenamiento en caché de indicadores y el esfuerzo que cada modelo requiere por tarea.
En SWE, Kimi K3 trabajó más que Fable 5 para llegar a sus resultados. El modelo abierto utilizó aproximadamente 55 turnos y 1,3 millones de tokens por tarea, frente a 21 turnos y 130.000 tokens de Fable 5.
La relación se invirtió en las operaciones largas de terminal. Allí, Fable 5 alcanzó 64 turnos y 1,5 millones de tokens, y en algunos casos llegó directamente a un tiempo de espera.
El almacenamiento en caché tuvo un papel importante en la conversión de ese esfuerzo en ahorro. Incluso cuando Kimi K3 leyó diez veces más tokens en SWE, los aciertos de caché permitieron que sus ejecuciones costaran menos que las de Fable 5.
El menor costo también implica una compensación operativa. Los turnos adicionales suelen aumentar el tiempo de ejecución, un factor relevante para respuestas inmediatas, aunque puede ser menos importante cuando los agentes trabajan en segundo plano y a gran escala.
El enrutamiento como estrategia para la inteligencia artificial
Fireworks definió el enrutamiento oracle como una forma de medir el mejor rendimiento teórico posible. El método ejecuta una tarea con cada modelo y después selecciona la opción correcta más barata.
Este mecanismo funciona como un techo de costo y rendimiento, no como un sistema práctico completamente desplegado. En una aplicación real, un enrutador debe predecir qué modelo ofrece la mejor relación entre calidad y precio sin probar previamente todas las alternativas.
En la evaluación, el enrutamiento oracle seleccionó a Kimi K3 para entre 72% y 96% de las tareas. Fireworks interpretó ese resultado como una señal de que un enrutador casi perfecto podría aprender las diferencias entre el trabajo cotidiano y la larga cola de tareas fronterizas.
La selección por tarea superó a la ejecución con un solo modelo. El sistema combinado logró una calidad general superior a la de cada modelo individual, con un costo cercano al de utilizar únicamente la opción optimizada para costos.
La empresa advirtió que todavía se necesita un orden de magnitud más de datos de enrutamiento y rendimiento en condiciones reales. Por eso, el resultado sugiere una dirección tecnológica, pero no establece de forma definitiva que todos los entornos obtendrán la misma ventaja.
Un modelo abierto como opción predeterminada
Al colocar el costo y la precisión en un mismo gráfico, Kimi K3 apareció a la izquierda de Fable 5 en las cinco familias de tareas evaluadas. Esa posición representa costos más bajos, mientras las diferencias verticales reflejan la ventaja de precisión de cada modelo.
Fable 5 mantuvo una ventaja en el conjunto multi-lenguaje. Kimi K3, por su parte, lideró en terminal y legal, mientras las dos herramientas quedaron aproximadamente igualadas en otras categorías.
El análisis plantea que los proveedores de modelo único podrían perder eficiencia frente a arquitecturas compuestas. La mejor solución ya no tendría que depender de un solo laboratorio, sino de una mezcla de modelos con especializaciones distintas.
Fireworks recomienda utilizar un modelo abierto y de menor costo como punto de partida. En su interpretación, un sistema como Kimi K3 debería recibir la mayoría del tráfico, mientras el modelo premium quedaría reservado para excepciones específicas.
El enrutador también funcionaría como una protección frente a cambios en la carga de trabajo. Si aprende continuamente qué modelo resuelve mejor cada tipo de tarea, una aplicación podría preservar su calidad y controlar sus costos sin depender de una sola opción.
Implicaciones para los agentes de IA
Los agentes de inteligencia artificial realizan tareas mediante múltiples turnos, herramientas externas y procesos de verificación. Por esa razón, el costo final depende tanto del precio por token como de la cantidad de pasos necesarios para completar el trabajo.
La comparación muestra que un modelo con menos turnos no siempre será el más barato. El comportamiento cambia según la categoría, el uso de caché y la capacidad del sistema para resolver una tarea sin quedar atrapado en ciclos prolongados.
También muestra que la precisión promedio no basta para elegir una herramienta. Dos modelos pueden obtener resultados casi idénticos en un referente general y, al mismo tiempo, diferir de forma importante en seguridad, programación, datos o criptografía.
El caso de Kimi K3 y Fable 5 respalda una estrategia de diversificación técnica. Las empresas podrían mantener un modelo abierto como base y recurrir a un sistema premium cuando la tarea exija una capacidad concreta.
La propuesta todavía requiere validación en cargas de trabajo reales y con enrutadores prácticos. Aun así, el estudio sugiere que la combinación de modelos especializados puede ofrecer una alternativa más eficiente que maximizar el uso de un único sistema.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Cinco gigantes tecnológicos acumulan USD $1,65 billones en deuda oculta vinculada con la IA
Análisis de mercado
Virtuals Protocol ($VIRTUAL) cae 4,8% y pone a prueba su rebote de julio: ¿oportunidad de compra o señal de venta?
Empresas
ServiceNow promete apagar agentes de IA rebeldes mientras defiende su crecimiento
Empresas