Cognition lanzó SWE-2, un modelo de programación postentrenado desde Kimi K3 que obtuvo 50% en FrontierCode 1.1 Main, cerca de Fable 5.1, con un costo reportado 64% menor. El sistema mejora a su modelo base en las pruebas citadas, aunque todavía enfrenta una brecha considerable en Terminal-Bench 4 y está disponible dentro de Devin Desktop y Devin CLI.
***
- SWE-2 logró 50,0% en FrontierCode 1.1 Main, a menos de un punto de Fable 5.1 y con 64% menos costo, según Cognition.
- El modelo fue postentrenado con aprendizaje por refuerzo a partir de Kimi K3, de Moonshot AI, y añadió entre cinco y seis puntos en varios benchmarks.
- SWE-2 no ofrece pesos abiertos ni una API independiente: funciona dentro de Devin Desktop o Devin CLI, con acceso sin costo adicional para los planes de pago durante un mes, hasta el 10 de octubre de 2026.
🚨 Cognition lanza SWE-2: 50% en FrontierCode 1.1 Main, cerca de Fable 5.1 y con 64% menos costo reportado.
Postentrenado desde Kimi K3, mejoró 5-6 puntos en varias pruebas.
⚠️ Terminal-Bench 4: 27,3% frente a 55,8%. Solo en Devin Desktop y CLI. pic.twitter.com/zqywskXbyl
— Diario฿itcoin (@DiarioBitcoin) September 13, 2026
Un modelo competitivo, pero cerrado
Cognition, la empresa detrás del agente de programación Devin, presentó SWE-2 como su modelo de programación más capaz hasta ahora. La compañía asegura que el sistema obtuvo 50,0% en FrontierCode 1.1 Main, a menos de un punto porcentual de Fable 5.1, aunque con un costo 64% inferior en esa comparación.
El modelo fue postentrenado mediante aprendizaje por refuerzo a partir de Kimi K3, un modelo de Moonshot AI descrito en los materiales de lanzamiento como un sistema de 2,8 billones de parámetros. Cognition sostiene que el ajuste posterior encontró un margen importante sobre la base original, con mejoras de entre cinco y seis puntos en varios de los benchmarks incluidos en su evaluación.
La disponibilidad de SWE-2 marca una diferencia frente a otros modelos que pueden descargarse o integrarse directamente en productos de terceros. Según la información de lanzamiento, el sistema no tiene pesos abiertos ni una API independiente, por lo que los usuarios deben acceder a él dentro de Devin Desktop o Devin CLI.
Cognition también anunció que SWE-2 estaría disponible sin costo adicional para los suscriptores de los planes Pro, Max y Teams durante un mes. Tomando como referencia su lanzamiento del 10 de septiembre de 2026, la promoción se extiende hasta el 10 de octubre de 2026.
Resultados desiguales en las pruebas
En la tabla divulgada por Cognition, SWE-2 superó a Kimi K3 en las cuatro pruebas comparadas. El nuevo modelo alcanzó 50,0% en FrontierCode 1.1 Main frente a 44,2% de Kimi K3, mientras que Fable 5.1 registró 50,9% y GPT-6 Astra llegó a 53,3% en la misma evaluación.
La ventaja resultó más amplia en DeepSWE 1.1, donde SWE-2 obtuvo 73,0%, frente a 68,5% de Kimi K3, 67,5% de Grok 4.6 y 67,4% de Fable 5.1. GPT-5.6 Sol alcanzó 72,7%, mientras que GPT-6 Astra quedó por delante con 74,1% y SWE-1.7 se situó en 37,7%.
En Terminal-Bench 2.1, el modelo de Cognition encabezó la comparación con 92,8%, por encima de Fable 5.1, con 91,4%, y GPT-6 Astra, con 89,9%. También superó a Kimi K3, que marcó 88,3%, aunque las cifras proceden de evaluaciones realizadas con los modelos en sus respectivos entornos nativos cuando no existían resultados públicos equivalentes.
El resultado cambia de forma drástica en Terminal-Bench 4, donde SWE-2 obtuvo 27,3%, muy por debajo de Fable 5.1, con 55,8%, y GPT-6 Astra, con 57,9%. Esta prueba representa el punto débil más claro del modelo, con una brecha cercana a 30 puntos frente a esos dos competidores.
Menos pasos para completar una tarea
Uno de los objetivos centrales del entrenamiento fue corregir la tendencia de SWE-1.7 a explorar demasiado incluso en tareas sencillas. Cognition describe el cambio como exploración enfocada, una estrategia que busca reducir desvíos sin sacrificar la calidad de la solución ni la cobertura de las verificaciones.
En FrontierCode 1.1 Main, la configuración medium de SWE-2 obtuvo una puntuación superior a SWE-1.7 mientras utilizó 58% menos turnos y costó 81% menos. El promedio de pasos por ejecución pasó de 127 en SWE-1.7 a 53 en medium, 80 en high y 98 en max, según los datos compartidos por la empresa.
El modelo también llegó antes a su primera edición efectiva del código. La mediana descendió de 48 pasos en SWE-1.7 a 18 pasos en SWE-2 medium, una diferencia que puede afectar tanto el tiempo de respuesta como el consumo de recursos en flujos de trabajo donde el agente debe inspeccionar, modificar y probar repositorios.
Cognition atribuyó parte de ese comportamiento a una mayor cobertura de pruebas de extremo a extremo, a la capacidad de encontrar alternativas cuando una herramienta queda bloqueada y a una disciplina de verificación más marcada. Cuando el sistema recibe una objeción, la empresa afirma que vuelve a derivar sus conclusiones en lugar de limitarse a reafirmar la respuesta anterior.
Una receta de aprendizaje por refuerzo orientada al costo
SWE-2 utiliza la infraestructura y la receta desarrolladas para SWE-1.7, que había sido postentrenado desde Kimi K2.7. La diferencia principal consiste en que Cognition llevó el aprendizaje por refuerzo a un régimen de varios billones de parámetros, apoyándose en una base casi tres veces mayor que la utilizada previamente.
El modelo es además el primero de Cognition con niveles seleccionables de esfuerzo de razonamiento. La compañía entrenó las configuraciones medium, high y max en una sola ejecución de aprendizaje por refuerzo, de modo que cada nivel cuenta con su propia penalización de costo y todos pueden moverse al mismo tiempo sobre la relación entre rendimiento y consumo.
La recompensa combina el éxito binario de una tarea con una penalización vinculada al costo de inferencia y al tiempo de ejecución, expresada por Cognition como R igual a S menos lambda por C. Para cada nivel de esfuerzo, lambda se fija a partir de la pendiente local de la frontera de Pareto del modelo base, con el objetivo de que la recompensa mejore solo cuando esa frontera avance.
El entrenamiento también emplea un punto de referencia ponderado por la longitud de cada ejecución, una técnica que Cognition dice utilizar desde SWE-1.6. En sus ablaciones, ese mecanismo mantuvo más baja la divergencia entre inferencia y entrenamiento y estabilizó el proceso sin añadir cómputo, mientras el servicio de ejecuciones agrupó solicitudes cercanas para elevar entre 10% y 20% el rendimiento por GPU y por solicitud.
Infraestructura, confiabilidad y límites de acceso
Para acelerar las ejecuciones, Cognition incorporó decodificación especulativa DSpark, con un modelo preliminar reentrenado mediante SpecForge. La empresa reportó un aumento de 15% en las longitudes de aceptación y explicó que el modelo preliminar continúa entrenándose en línea junto con la política principal.
Los kernels NVFP4 y FP8, junto con un entrenamiento consciente de la cuantización, buscan limitar el uso de memoria y reducir el desajuste entre el entorno de entrenamiento y el de inferencia. Cognition también triplicó sus entornos de aprendizaje por refuerzo y añadió capas de seguimiento de instrucciones para ampliar el conjunto de situaciones observadas por el modelo.
El sistema de datos incorpora un ciclo de mejora que utiliza checkpoints anteriores de SWE-2 para localizar falsos positivos y falsos negativos en los verificadores. Esa estrategia apunta a un problema habitual en los agentes de programación: una respuesta puede parecer correcta durante la evaluación, pero fallar cuando el código enfrenta pruebas más completas o condiciones de ejecución diferentes.
La empresa repitió dos evaluaciones de su estudio de confiabilidad de código abierto para examinar el comportamiento del modelo en escenarios sensibles. En 145 preguntas políticamente delicadas sobre China, SWE-2 alcanzó una tasa general de aprobación de 98,0%, con 99,8% en inglés, 95,2% en chino simplificado y 99,1% en chino tradicional.
En otra prueba sobre vulnerabilidades dependientes del contexto y distintos encuadres de clientes, ningún encuadre produjo un cambio estadísticamente significativo para ninguno de los modelos evaluados. Estos resultados no eliminan las limitaciones observadas en Terminal-Bench 4, pero ofrecen un contrapunto frente a la preocupación de que los cambios de contexto alteren de forma sustancial las respuestas de seguridad.
La presentación de SWE-2 refuerza la competencia por construir agentes capaces de programar con menos pasos y menor costo, un factor que puede pesar más que una puntuación aislada cuando las tareas se ejecutan a gran escala. Sin embargo, el acceso exclusivo a Devin y la diferencia entre benchmarks dejan claro que el modelo todavía debe demostrar un desempeño más consistente antes de convertirse en una opción general para equipos externos.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Void Linux deja huérfanos 113 paquetes tras aplicar reglas sobre contenido generado por IA
China
Moonshot AI denuncia ante la policía rumores sobre la detención de su fundador y empleados
Educación
Un experimento universitario sugiere que prohibir la IA puede perjudicar a los estudiantes
Juegos

