CLM-8B no redacta respuestas: compara acciones posibles y asigna probabilidades. Sus creadores reportan que puede superar en velocidad al sistema propietario Jev, aunque las pruebas también muestran escenarios donde Jev conserva una ventaja en precisión.
***
- CLM-8B puntúa alternativas de acción en lugar de generar texto y ofrece una interfaz compatible con la API de TypeSafe.
- En una prueba del juego T-Rex registró 16,5 milisegundos de latencia frente a 149,8 de Jev, con el mismo resultado de éxito.
- En subconjuntos de evaluación de código, las versiones ajustadas de CLM superaron las cifras de Jev y respondieron entre 4,1 y 5,7 veces más rápido.
Un modelo que puntúa en vez de redactar
Contrastive-LM presentó CLM-8B, un modelo abierto que pertenece a una categoría denominada Modelos de Lenguaje Contrastivos, o CLMs. A diferencia de un modelo generativo convencional, no produce una respuesta en texto: compara un estado con un conjunto de acciones candidatas y devuelve probabilidades para esas opciones. La propuesta busca que un agente pueda decidir cuál es el siguiente paso sin tener que generar una explicación completa en cada turno.
El sistema apunta a una interfaz similar a la de Jev, el modelo System One propietario de TypeSafe AI, que entró en acceso anticipado limitado el 15 de septiembre de 2026. Jev entrega valores tipados con probabilidades, en lugar de texto libre, y CLM intenta ofrecer esa misma clase de interacción. Según la información difundida sobre el lanzamiento, el repositorio de CLM incluye una API compatible con TypeSafe y permite reproducir solicitudes escritas para esa interfaz mediante su cliente de Python.
La API de CLM contempla tres tipos de consulta. Noul estima la probabilidad de que una afirmación sea verdadera; Choice selecciona entre opciones declaradas y asigna probabilidades, mientras que Score devuelve un nivel esperado dentro de una rúbrica ordenada. En conjunto, estas operaciones permiten plantear decisiones estructuradas sin convertir cada resultado en una respuesta narrativa.
La ficha del proyecto describe CLM-8B como un sistema desplegable en Linux con una GPU NVIDIA, usando vLLM para servir el codificador Qwen3-8B. Su cabecera, distribuida bajo la licencia Apache-2.0, ocupa 75 MB, una característica que facilita probar esa parte del sistema sin confundirla con el tamaño del codificador completo. El enfoque apunta a equipos que quieran alojar la herramienta en su propia infraestructura, aunque el rendimiento concreto dependerá de la tarea y de la configuración utilizada.
Cómo calcula y reutiliza las puntuaciones
CLM entrena un codificador para estados y otro para acciones mediante una pérdida contrastiva InfoNCE bidireccional. Cada uno parte de un modelo Qwen3-8B congelado y añade una cabeza de proyección entrenable de 20 millones de parámetros. Durante el aprendizaje, el sistema acerca la representación de un estado a la acción que realmente se tomó y la aleja de las alternativas restantes.
En tiempo de inferencia, el modelo calcula el producto punto entre las representaciones del estado y de cada acción candidata. Después aplica una función softmax a esas puntuaciones para obtener una distribución de probabilidades, que sirve como respuesta tipada. El mismo mecanismo puede ordenar soluciones generadas por separado, decidir a qué herramienta dirigir una solicitud o contestar una elección estructurada.
La separación entre estado y acción también permite reutilizar cálculos en los bucles de agentes. El estado suele cambiar en cada paso, mientras que el conjunto de acciones posibles puede mantenerse casi igual; por eso, CLM puede conservar vectores ya calculados en memoria y evitar repetir parte del trabajo. El servicio clm-serve reserva un bloque de memoria de GPU para ese propósito, de manera similar a la caché KV que usa vLLM.
En una RTX 4090 y con tres acciones, el equipo reportó que la latencia para estados revisitados bajó de 1,7 a 0,6 milisegundos mediante el uso de vectores almacenados en caché. La ficha del modelo también afirma que CLM puede ejecutarse 13 veces más rápido que Jev cuando hay alrededor de 1.000 candidatos. Esas cifras se refieren a condiciones y configuraciones concretas, por lo que no describen automáticamente el rendimiento en cualquier agente o carga de trabajo.
Entrenamiento y pruebas de velocidad
El entrenamiento se dividió en tres etapas. En el preentrenamiento, CLM utilizó cerca de 60 millones de pares de pregunta y respuesta de Nemotron DQA; después incorporó unos 30 millones de negativos difíciles sintéticos generados con Gemini 2.5 Flash-Lite. La etapa final sumó aproximadamente un millón de trayectorias de agentes procedentes de Agent Data Protocol, Endless-Terminals y LiteCoder-Terminal-SFT.
En cerca de 100.000 preguntas de validación, el modelo alcanzó una precisión top-1 de 52,1% después del preentrenamiento y subió a 69,2% tras el entrenamiento intermedio con negativos difíciles. El equipo también probó incluir esos ejemplos difíciles desde el comienzo, pero esa ruta llegó a un máximo de 62,4% antes de sobreajustarse. La comparación sugiere que el orden de las etapas influyó en los resultados reportados, sin demostrar por sí sola que la misma receta sea óptima para otras tareas.
En las pruebas zero-shot, CLM-8B tuvo una latencia de 16,5 milisegundos en el juego T-Rex, frente a 149,8 de Jev, y ambos lograron éxito en cinco de cinco intentos. En Super Mario, CLM marcó 33,5 milisegundos frente a 132,6, con cinco éxitos de cinco para cada modelo. La diferencia de velocidad en T-Rex equivale a cerca de nueve veces, de donde surge la cifra destacada en el lanzamiento.
El panorama cambió en tareas que exigían elegir herramientas o recorrer información. En tool calling con BFCL v4, CLM registró 76,8 milisegundos y 95,2% de éxito, mientras Jev necesitó 125,5 milisegundos y obtuvo 99,2%; en WikiRacing, los resultados fueron 79,8 milisegundos y 26 de 30 para CLM, frente a 225 milisegundos y 30 de 30 para Jev. Así, las cifras muestran una ventaja de velocidad de CLM en las cuatro tareas, pero también una menor tasa de éxito en esas dos evaluaciones.
El uso como verificador de soluciones de código
El equipo también evaluó CLM como verificador: un modelo generador produce varias soluciones candidatas y el sistema las puntúa para seleccionar una. Para DeepSWE, las candidatas de best-of-4 fueron generadas con Opus 5; para Terminal-Bench 2.1, Fable 5 produjo el conjunto best-of-5. Las pruebas abarcaron 38 tareas de validación de DeepSWE y 30 de Terminal-Bench 2.1, con latencias medidas en una H100.
En DeepSWE, la línea base pass@1 fue de 73,7%; CLM ajustado alcanzó 81,6% y Jev, 71,1%. En Terminal-Bench 2.1, las cifras respectivas fueron 84,0% para pass@1, 87,6% para CLM y 83,1% para Jev. En ambos casos, las versiones ajustadas de CLM superaron las cifras de referencia incluidas en la evaluación, mientras Jev quedó por debajo de pass@1.
La latencia de CLM en esas pruebas fue de 79 milisegundos en DeepSWE y 32 en Terminal-Bench 2.1; Jev registró 449 y 131 milisegundos, respectivamente. El equipo calculó que CLM fue entre 4,1 y 5,7 veces más rápido, según el benchmark. Para estos resultados utilizó cabezas ajustadas ligeras, no el checkpoint zero-shot, una diferencia importante al interpretar la comparación.
Los investigadores presentan las cifras como nuevos resultados de vanguardia para verificación, pero corresponden a subconjuntos de validación y no a envíos completos a las tablas de clasificación. Ese alcance limita las conclusiones: los datos describen los grupos de tareas medidos y no prueban que CLM vaya a superar a Jev en todos los escenarios. También explican por qué conviene separar el rendimiento del verificador ajustado de los resultados zero-shot.
Qué muestran los resultados y qué queda por comprobar
El aporte central de CLM-8B es una forma distinta de resolver decisiones de agentes: puntuar un conjunto definido de posibilidades en vez de redactar una respuesta abierta. Esa estructura puede ser útil cuando el sistema debe escoger una herramienta, comparar varias soluciones o asignar un nivel dentro de una rúbrica. La caché de vectores busca reducir trabajo repetido cuando un agente vuelve a encontrar estados o acciones similares.
Las pruebas reportadas dibujan una compensación entre latencia y éxito, no una victoria uniforme. CLM fue más rápido en las cuatro tareas zero-shot comparadas con Jev, pero obtuvo menos éxito en tool calling y WikiRacing; en T-Rex y Super Mario igualó los resultados medidos. En las evaluaciones de código, las cabezas ajustadas de CLM superaron las cifras de Jev y pass@1 en los subconjuntos examinados, aunque el diseño y el tamaño de esas pruebas acotan la generalización.
La disponibilidad de una cabecera Apache-2.0 y la posibilidad de operar el sistema en una GPU NVIDIA ofrecen una alternativa abierta frente a un modelo propietario, pero no eliminan la necesidad de evaluar cada caso de uso. Los equipos deberán considerar tanto la latencia como la calidad de selección, además de comprobar si la compatibilidad de API encaja con sus agentes. El lanzamiento aporta resultados iniciales y una receta reproducible en sus componentes publicados, pero la información suministrada no establece cómo rendirá CLM en despliegues más amplios.
En suma, CLM-8B plantea que la toma de decisiones de un agente puede tratarse como un problema de puntuación y no necesariamente de generación de texto. Su ventaja de velocidad destaca en algunas mediciones, mientras que Jev conserva mejores tasas de éxito en otras; por ahora, la evidencia invita a comparar ambos sistemas según la tarea concreta y no solo por una cifra de latencia.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Energía
La red eléctrica podría aplazar hasta los años 2030 la supercomputadora de Nscale en Reino Unido
Empresas
ElevenLabs podría alcanzar una valoración de USD $22.000 millones en una oferta secundaria
Estados Unidos
La NSA destinaría miles de millones a probar modelos de inteligencia artificial
Hyperscalers
