Fireworks AI presentó Nexus, una capa de gestión y enrutamiento que busca reducir el costo de la codificación asistida por IA al enviar las tareas rutinarias a modelos de peso abierto y reservar los modelos de frontera para los problemas más complejos.
***
- Fireworks Nexus combina controles empresariales, continuidad para herramientas de programación y un enrutador que clasifica las solicitudes según su dificultad.
- La compañía afirma que el sistema puede reducir los costos entre tres y cinco veces, aunque los resultados divulgados todavía corresponden a pruebas preliminares.
- Evaluaciones de Faros AI y Arize sugieren que una escalera de escalamiento puede superar a un único modelo cuando equilibra calidad y costo.
Fireworks AI lanza Nexus para controlar el costo de la codificación con IA
Una respuesta al aumento del gasto en agentes de programación
Fireworks AI lanzó Fireworks Nexus, una plataforma de gestión y enrutamiento de inteligencia artificial dirigida a organizaciones de ingeniería. La herramienta conecta los entornos de codificación existentes con una capa administrada de modelos de peso abierto.
El anuncio llega cuando las empresas enfrentan un aumento acelerado en el uso de agentes capaces de escribir, revisar y modificar código. MarkTechPost citó el caso de Uber, cuyo presupuesto total de IA para 2026 se habría agotado en cuatro meses.
El mismo reporte señaló que Claude Code alcanzó aproximadamente 5.000 ingenieros después de su lanzamiento en diciembre. Según los datos citados por Fireworks, la adopción de herramientas agentic pasó de cerca de un tercio de los ingenieros a más de cuatro quintas partes en apenas dos meses.
Fireworks interpreta el problema como un desajuste de precios, no necesariamente como un exceso de consumo. Su argumento es que muchas organizaciones ejecutan tareas rutinarias con modelos de frontera, aunque esas solicitudes no siempre requieren el máximo nivel de capacidad.
El cambio hacia modelos de peso abierto suele resultar poco atractivo para los equipos de plataforma. La compañía sostiene que Nexus intenta resolver esa barrera sin obligar a los desarrolladores a modificar las herramientas que ya utilizan.
Los tres componentes de Fireworks Nexus
El primer componente de Nexus reúne controles empresariales y herramientas de observabilidad de costos. Los equipos pueden establecer presupuestos por departamento o para toda la empresa, además de seguir el retorno de inversión entre modelos y aplicaciones.
La plataforma también permite aplicar políticas desde un solo lugar. Las solicitudes se ejecutan en la infraestructura de inferencia de producción de Fireworks, con puntos finales alojados en Estados Unidos, cero retención de datos y cobertura en 20 centros de datos globales.
El segundo componente se denomina FireConnect y busca preservar la continuidad del flujo de trabajo. Se trata de una instalación de una línea que asigna espacios de modelos del entorno de programación a modelos disponibles en Fireworks.
FireConnect se publica bajo la licencia Apache 2.0 y puede instalarse desde el tablero de Fireworks con un solo comando. Claude Code, Codex y OpenCode pueden continuar operando sin cambios importantes, según la compañía.
El tercer componente es la gestión inteligente del tráfico. Un modelo entrenado a medida estima la dificultad de cada solicitud y envía las tareas rutinarias a un modelo de peso abierto de menor costo, mientras reserva los proveedores existentes para los desafíos más complejos.
Cómo funciona el enrutamiento entre modelos
Cuando una solicitud parece sencilla, Nexus puede dirigirla hacia un modelo abierto proporcionado por Fireworks. La empresa afirma que este mecanismo suele generar una reducción de costos de entre tres y cinco veces.
Las tareas consideradas difíciles pasan al proveedor que la organización ya utiliza mediante su propia clave. Fireworks asegura que esa clave no se almacena en sus servidores, un aspecto relevante para compañías que controlan sus credenciales y políticas de acceso.
La compatibilidad técnica se apoya en las interfaces de programación de Fireworks compatibles con Anthropic y OpenAI. En la práctica, muchas herramientas pueden conectarse mediante el cambio de una URL base y un identificador de modelo.
El enrutador todavía se encuentra en una vista previa de investigación. Actualmente puede operar entre Claude Opus 5 y GLM-5.2, por lo que la ruta de transferencia requiere una clave de Anthropic.
También existe una configuración completamente abierta. En ese caso, el sistema enruta entre Kimi K3 y GLM-5.2, sin depender de un modelo cerrado en el camino de escalamiento.
Resultados preliminares y evaluaciones independientes
El equipo de investigación de Fireworks probó Nexus con equipos de desarrollo de empresas como Notion y Doximity. Los resultados preliminares muestran una reducción cercana a un tercio en el costo por solicitud de extracción combinada.
Fireworks también informó que la tasa combinada de tokens equivale aproximadamente a una cuarta parte de la registrada por laboratorios de modelos cerrados. La compañía advierte que estas cifras provienen de un programa de vista previa y deben leerse como datos de proveedor.
Una referencia adicional procede de Faros AI, que ejecutó 211 tareas de ingeniería reales extraídas de 12 repositorios mediante siete rutas de modelos y entornos de ejecución. En su evaluación, Claude Code con GLM-5.2 obtuvo una puntuación de 0,568 en un juez basado en una rúbrica de modelo.
Claude Code con Opus 4.8 alcanzó 0,521 en la misma medición. La diferencia de costos fue mayor que la brecha de calidad: USD $0,92 por tarea para GLM-5.2 frente a USD $1,76 para Opus 4.8.
La participación de caché llegó a 89,7% y 99,7%, respectivamente. Faros AI indicó que la cohorte era específica de una empresa y no debía interpretarse como una clasificación universal de modelos.
La escalera de escalamiento como estrategia
Arize, en un estudio conjunto con Fireworks, evaluó 10 modelos en 40 tareas de Terminal-Bench. Cada modelo pasó por seis ensayos, para un total de 2.400 ejecuciones y un gasto de API de USD $626.
La métrica principal fue el costo por tarea exitosa. Ese cálculo incluye cada intento fallido y cada reintento, por lo que busca reflejar el precio real de completar una tarea, no solo el costo de una llamada individual.
En las tareas fáciles, la evaluación sugirió que pagar una prima por un modelo de frontera no siempre aporta una ventaja. Kimi K2.6 alcanzó una tasa de aprobación de 73%, mientras GPT-5.5 registró 69%.
El panorama cambió en las tareas difíciles. GPT-5.5 obtuvo 51% y Kimi K3 llegó a 32%, lo que muestra que los modelos de mayor capacidad todavía pueden marcar una diferencia cuando aumenta la complejidad del problema.
La estrategia de escalamiento deliberada alcanzó un costo de USD $0,525 por tarea exitosa y resolvió de forma confiable 32,3 de 40 tareas. GPT-5.5 por sí solo costó USD $0,636 y resolvió 25 de 40, mientras el escalamiento ingenuo entre los 10 modelos costó USD $1,319.
Activación y límites para los equipos técnicos
Los equipos tienen tres rutas prácticas para activar la solución. FireConnect ofrece la menor fricción, aunque requiere que el cliente de Claude Code ya esté disponible en el sistema y solicita una clave de API de Fireworks durante la configuración.
El instalador registra un mercado de complementos y modifica los ajustes de Claude Code con una copia de seguridad marcada con fecha y hora. También expone los comandos /fireconnect:on, /fireconnect:off, /fireconnect:setup, /fireconnect:models y /fireconnect:set-models.
La segunda ruta prescinde completamente del complemento. Los usuarios pueden establecer ANTHROPIC_BASE_URL junto con una clave de Fireworks, o emplear el cliente compatible con OpenAI cambiando la URL base y el identificador del modelo.
Arize señaló que incorporar un nuevo modelo a su entorno de evaluación requirió una sola línea de configuración. Esa intercambiabilidad permite construir una escalera de escalamiento y ajustar sus niveles a las cargas de trabajo de cada empresa.
La tercera ruta coloca el enrutador frente a un contrato existente con un proveedor de frontera. El principal límite actual es que se trata de una vista previa de investigación, por lo que las compañías deberán validar el desempeño con sus propios repositorios antes de generalizar sus resultados.
La evidencia disponible respalda una conclusión prudente: el enrutamiento por dificultad puede ofrecer una relación más eficiente entre costo y calidad que elegir un modelo por reputación. Fireworks Nexus intenta convertir esa idea en una capa operativa para organizaciones que ya enfrentan facturas crecientes de codificación asistida por IA.
Sin embargo, los resultados todavía dependen de las tareas, los repositorios, el modelo de evaluación y la configuración de caché. La reducción de costos anunciada por Fireworks resulta atractiva, pero deberá contrastarse con cargas de trabajo más amplias y con pruebas independientes de cada empresa.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
BIS advierte que el auge de la IA podría nublar las señales de inflación
China
China domina la carrera de robots humanoides con seis de las 10 startups más innovadoras
Empresas
La historia sobre un posible token de IA vinculado a OpenAI y Anthropic no está disponible
AltCoins