Ornith-1.5 propone tareas, genera los andamios para resolverlas y produce despliegues que alimentan su aprendizaje por refuerzo. El sistema, presentado en versiones de 397B, 35B y 9B parámetros, busca convertir la automejora de modelos abiertos en un ciclo continuo, con resultados competitivos en codificación, razonamiento y tareas de agente.
***
- Ornith-1.5 amplía el autoandamiaje de su antecesor para optimizar conjuntamente tareas, estrategias y soluciones.
- La versión Ornith-1.5-397B obtuvo 86,1 en Terminal-Bench 2.1 y 56,0 en DeepSWE, cerca de Claude Opus 4.8.
- El modelo compacto Ornith-1.5-9B puede ejecutarse en dispositivos móviles y alcanzó 70,6 en SWE-Bench Verified.
Un ciclo cerrado para mejorar modelos
Ornith presentó Ornith-1.5 como una evolución de su marco de autoandamiaje, con el objetivo de avanzar hacia modelos fundacionales capaces de mejorar de extremo a extremo. La nueva versión no se limita a optimizar instrucciones o despliegues diseñados previamente, sino que propone nuevas tareas, construye andamios específicos para cada desafío y genera soluciones que luego alimentan el aprendizaje por refuerzo. El enfoque busca que el propio modelo amplíe de manera continua su experiencia de entrenamiento en razonamiento, codificación y operaciones como agente.
El sistema trabaja a partir de un entorno o una base de código, instrucciones generales sobre el tipo de problema y el historial de tareas que ya resolvió. Con esos elementos, Ornith-1.5 genera progresivamente retos más complejos que se sitúan más allá de sus capacidades consolidadas, una estrategia destinada a revelar brechas y mantener activa la frontera de aprendizaje. Cuando una tarea deja de representar un desafío suficiente, su valor disminuye y el generador debe buscar otra con mayor potencial informativo.
Para cada problema, el modelo también crea o refina un andamio que reúne instrucciones, herramientas, estrategias de descomposición y mecanismos de orquestación. Después, la política produce un despliegue de solución condicionado por la tarea y por ese andamio, mientras la recompensa obtenida se propaga a las tres etapas. De esta manera, el entrenamiento no solo premia una respuesta correcta, porque también enseña a formular mejores tareas y a diseñar entornos más eficaces para resolverlas.
Ornith explicó que la repetición de este proceso forma un bucle de automejora cerrado: políticas más fuertes permiten generar tareas más difíciles, los andamios evolucionan para aprovechar mejor las capacidades disponibles y los despliegues de mayor calidad entregan señales de entrenamiento más útiles. El planteamiento sustituye una distribución estática de datos y parte del diseño artesanal de agentes por un currículo que se adapta a la evolución del modelo. En términos prácticos, la compañía intenta automatizar no solo la resolución de problemas, sino también la construcción del camino que conduce a resolverlos.
Cómo decide qué tareas merecen entrenamiento
El mecanismo asigna a cada configuración de pregunta, andamio y despliegues una recompensa de tarea formada por tres señales multiplicativas: validez, dificultad fronteriza y novedad. La primera responde si la tarea puede ejecutarse y verificarse correctamente; la segunda evalúa si presenta un desafío adecuado para el nivel actual del modelo; la tercera reduce la repetición de problemas demasiado parecidos. Al multiplicarlas, el sistema evita que una tarea mal formada, trivial o redundante reciba una recompensa elevada por una sola característica.
La validez puede tomar un valor entre cero y uno y también funcionar como una condición estricta que anula la recompensa cuando el entorno no resulta confiable. Ornith comprueba, entre otros aspectos, si el andamio se ejecuta correctamente, si las soluciones consideradas de alta confianza superan la evaluación y si los resultados claramente incorrectos fallan. Estas verificaciones intentan impedir que el modelo confunda una tarea aparentemente difícil con un entorno de aprendizaje que en realidad contiene errores de diseño.
La dificultad se estima mediante varios despliegues de solución y su tasa empírica de éxito, calculada a partir de cuántas trayectorias completan correctamente la tarea. El objetivo se fija en una tasa de éxito de 0,2, de modo que el sistema favorece problemas exigentes, pero todavía capaces de producir suficientes ejemplos exitosos para el aprendizaje por refuerzo. Si el modelo mejora y comienza a resolver una tarea de forma habitual, la recompensa asociada cae y el generador queda incentivado a buscar un desafío superior.
La novedad completa el mecanismo al comparar cada pregunta con un conjunto de tareas generadas o utilizadas anteriormente. Su función consiste en reducir variaciones redundantes del mismo problema, aunque Ornith subraya que no debe dominar la validez ni la dificultad. El resultado esperado es un currículo de tareas verificables, aprendibles y diversas, cuya exigencia cambia a medida que también cambia la capacidad de la política entrenada.
El arnés como parte del aprendizaje
Ornith-1.5 considera el arnés, o entorno de evaluación, como una pieza que también debe optimizarse. Para ello, le asigna una recompensa basada en la alineación con la tarea, la fidelidad con la calidad real de las soluciones y la resistencia al hackeo de recompensas. La idea responde a un riesgo conocido en los sistemas de aprendizaje por refuerzo: un evaluador mal diseñado puede premiar atajos que producen una puntuación alta sin resolver el problema que se pretendía medir.
La alineación determina si el arnés refleja fielmente la especificación de la tarea, mientras la fidelidad examina si sus recompensas siguen el desempeño efectivo de las soluciones candidatas. El tercer componente busca detectar fallas del evaluador, comportamientos oportunistas y formas de manipulación que permitan obtener crédito sin cumplir los requisitos. En tareas verificables, el resultado puede resumirse en aprobado o reprobado; en entornos más complejos, puede combinar corrección, finalización, eficiencia y cumplimiento de restricciones.
Cada despliegue recibe directamente la puntuación que produce el arnés generado para esa tarea. Esa conexión permite que la evaluación funcione como una señal de aprendizaje, pero también exige controles para impedir que el modelo construya pruebas favorables a sus propias respuestas. Según la explicación de Ornith, la generación de preguntas, la creación de arneses y la producción de soluciones se optimizan con GRPO y sus respectivas recompensas dentro del mismo bucle.
La arquitectura, por tanto, distribuye la responsabilidad entre tres actores que en muchos procesos de entrenamiento permanecen separados: quien formula el examen, quien construye el evaluador y quien intenta resolverlo. Si el mecanismo funciona como espera la empresa, cada componente puede corregir sus limitaciones a partir de la información que producen los otros dos. El reto central será mantener verificabilidad y diversidad mientras las políticas adquieren capacidad para anticipar las reglas del entorno.
Rendimiento del modelo insignia
Ornith-1.5 se ofrece en tres escalas: un modelo MoE de 397B parámetros, otro MoE de 35B y un modelo denso de 9B. En la configuración insignia, Ornith-1.5-397B consiguió 86,1 en Terminal-Bench 2.1 con Terminus-2, frente a 85,0 de Claude Opus 4.8, aunque Kimi K3 registró 88,3. En DeepSWE, el modelo obtuvo 56,0, por debajo de los 59,0 de Claude Opus 4.8 y de los 67,5 de Kimi K3, pero por encima de DeepSeek-V4-Flash-0731, con 54,4, y GLM-5.2, con 46,2.
En Terminal-Bench 2.1 evaluado con Claude Code, la versión de 397B alcanzó 85,2, frente a 78,9 de Claude Opus 4.8, 82,7 de GLM-5.2 y 81,8 de DeepSeek-V4-Flash-0731. También obtuvo 86,0 en SWE-Bench Verified y 65,1 en SWE-Bench Pro, mientras que en SWE-Bench Multilingüe llegó a 79,6. Estos resultados muestran una ventaja frente a varios modelos abiertos comparables, aunque los marcadores no colocan al sistema por encima de todos los competidores en cada prueba.
El desempeño fue igualmente amplio en razonamiento y tareas de agente, aunque con diferencias según la evaluación. Ornith-1.5-397B logró 44,6 en HLE sin herramientas y 56,1 con herramientas, además de 92,8 en GPQA Diamond; en MCP-Atlas alcanzó 80,0 y en Toolathlon-Verified, 71,2. En WideSearch registró 80,8, en BrowseComp 86,6 y en ClawEval 81,4, cifras que ilustran la intención de la compañía de construir un modelo generalista, no únicamente un sistema de programación.
La comparación con Ornith-1.0 también refleja mejoras relevantes en varias pruebas, especialmente en codificación y operación como agente. Por ejemplo, la versión anterior consiguió 77,5 en Terminal-Bench 2.1 con Terminus-2, 82,4 en SWE-Bench Verified y 8,0 en DeepSWE, frente a 86,1, 86,0 y 56,0 de Ornith-1.5, respectivamente. La diferencia en DeepSWE es particularmente marcada y coincide con el objetivo declarado de ampliar el autoandamiaje hacia la generación conjunta de tareas y soluciones.
Modelos menores y ejecución en dispositivos
La versión Ornith-1.5-35B-A3B activa solo 3B de parámetros por token, una característica propia de su diseño MoE, y aun así superó ampliamente a Qwen3.6-35B-A3B en las pruebas de codificación y agente incluidas en la evaluación. Obtuvo 67,8 en Terminal-Bench 2.1 con Terminus-2 y 68,5 con Claude Code, frente a 52,5 y 49,2 de Qwen3.6-35B-A3B. En SWE-Bench Verified, la diferencia fue de 79,0 contra 73,4.
El modelo de 35B también quedó por encima de modelos densos de tamaño parecido en varios indicadores, pese a que su activación por token es mucho menor. En Terminal-Bench 2.1 con Terminus-2 marcó 67,8, frente a 42,1 de Gemma-4-31B y 51,7 de Muse-Glimmer-30B, mientras que en SWE-Bench Verified registró 79,0 contra 52,0 y 76,0. En razonamiento alcanzó 89,2 en GPQA Diamond, y en tareas de agente obtuvo 70,2 en MCP-Atlas y 72,5 en ClawEval.
Ornith-1.5-9B busca llevar esa estrategia de eficiencia a dispositivos de borde, con una versión cuantificada denominada Ornith-1.5-9B-Mobile para teléfonos iPhone y Android. En la tabla reportada, el modelo de 9B consiguió 46,2 en Terminal-Bench 2.1 con Terminus-2, 47,0 con Claude Code y 70,6 en SWE-Bench Verified. Sus cifras superan a Gemma-4-31B en Terminal-Bench con Terminus-2, 42,1, y en SWE-Bench Verified, 52,0, aunque no rebasan a todos los modelos mayores en cada indicador.
El modelo compacto también mejoró frente a Ornith-1.0-9B en todos los marcadores destacados de la tabla, entre ellos HLE sin herramientas, que pasó de 16,8 a 20,2, y GPQA Diamond, que subió de 82,5 a 86,4. En tareas de agente obtuvo 54,2 en MCP-Atlas, 41,2 en Toolathlon-Verified, 59,5 en WideSearch, 56,4 en BrowseComp y 66,5 en ClawEval. La posibilidad de ejecutar una versión cuantificada en móviles amplía el interés del proyecto más allá de los centros de datos, aunque el material presentado no detalla requisitos de hardware ni consumo energético.
Qué significan las cifras y qué falta comprobar
Los resultados sugieren que Ornith-1.5 compite con modelos abiertos de mayor escala en áreas donde la calidad del agente depende tanto del razonamiento como del uso de herramientas y la navegación por código. Sin embargo, las comparaciones deben leerse junto con los arneses, las ventanas de contexto, las temperaturas y las condiciones de cada prueba, porque esos elementos pueden modificar el rendimiento observado. La propia tabla combina evaluaciones con Terminus-2, Claude Code, OpenHands y otros entornos, por lo que no todos los números son directamente intercambiables.
La empresa informó que todos los resultados de Ornith-1.5 se promediaron en cinco ejecuciones independientes. Terminal-Bench 2.1 utilizó temperatura de 1,0, top_p de 1,0 y una ventana de contexto de 128K, mientras que las pruebas de SWE-Bench emplearon OpenHands, temperatura de 1,0, top_p de 0,95 y contexto de 256K. En SWE-Bench, además, se eliminó el historial de Git de las imágenes de los repositorios y se deshabilitó el acceso a la red para limitar la recuperación de soluciones o recursos externos.
DeepSWE se evaluó con el arnés de Claude Code, temperatura de 1,0, top_p de 0,95 y contexto de 256K, mientras NL2Repo utilizó contexto de 400K y una salida máxima de 48K. HLE contó con Claude 4.6 Opus como modelo juez, MCP-Atlas evaluó 500 tareas públicas con Claude 4.8 Opus como juez y un límite de diez minutos por tarea, y ClawEval se ejecutó con temperatura de 0,6 y contexto de 256K. Estos detalles no invalidan los resultados, pero ayudan a entender por qué la reproducibilidad y la transparencia del protocolo serán importantes para valorar el avance.
La propuesta de automejora también abre interrogantes sobre la estabilidad de los objetivos y la seguridad de los evaluadores. Un modelo capaz de generar sus propios problemas podría ampliar su currículo de forma productiva, pero también tender hacia tareas que favorezcan sus estrategias conocidas o exploten debilidades del arnés. El éxito de Ornith-1.5 dependerá, por ello, no solo de sus puntuaciones actuales, sino de que el ciclo mantenga diversidad, dificultad útil y verificabilidad cuando opere durante periodos prolongados.
Ornith-1.5 representa un intento ambicioso de convertir el entrenamiento de agentes en un proceso que se diseña y se corrige a sí mismo. Sus tres escalas cubren desde un modelo insignia de 397B hasta una alternativa móvil de 9B, mientras el bucle conjunto de tareas, andamios y soluciones busca sostener las mejoras sin depender exclusivamente de conjuntos humanos fijos. La evidencia presentada es sólida en varias pruebas, pero la siguiente etapa consistirá en comprobar si esas ganancias se mantienen fuera de los entornos de evaluación que la compañía utilizó.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Replit estrena un Modo Gratis con GPT-5.6 Luna para ahorrar créditos de IA
Empresas
La IA agéntica obliga a las empresas a resolver sus nuevos costos y riesgos
China
La carrera de SK Hynix y CXMT que puede redefinir el mercado mundial de memoria
Hardware
