Por Canuto  

IBM presentó Granite 4.2, una familia de modelos abiertos que incorpora razonamiento explícito y aprendizaje por refuerzo agéntico para programar, operar terminales y realizar búsquedas en entornos reales. La compañía también lanzó modelos de voz de 470 millones de parámetros orientados a la transcripción de alto rendimiento.
***

  • Granite 4.2 ofrece modelos densos de 3B, 8B y 30B parámetros bajo licencia Apache 2.0.
  • El aprendizaje por refuerzo agéntico para código, terminales y búsquedas está disponible en las versiones 8B y 30B.
  • IBM también presentó Granite Speech 5.0 Turbo CTC, modelos de voz de 470 millones de parámetros sin respaldo de un modelo de lenguaje.


IBM presentó Granite 4.2, una nueva familia de modelos de lenguaje abiertos orientados al razonamiento y al uso empresarial. La línea incluye versiones de 3.000 millones, 8.000 millones y 30.000 millones de parámetros, todas distribuidas bajo la licencia Apache 2.0, que permite descargar los pesos, ajustarlos y utilizarlos en producción comercial sin una barrera de licencia específica.

El lanzamiento marca un cambio frente a las versiones anteriores de Granite, concebidas principalmente como asistentes capaces de seguir instrucciones. En Granite 4.2, cada modelo puede emitir una cadena de razonamiento antes de responder, además de ofrecer en su plantilla de conversación controles separados para activar el pensamiento, desactivarlo o utilizar un modo de bajo esfuerzo con un presupuesto reducido para preguntas sencillas.

Una familia abierta con distintos objetivos de despliegue

Los tres modelos comparten una arquitectura de transformador denso y solo decodificador, en lugar de utilizar un diseño híbrido o una mezcla de expertos. IBM los orienta a escenarios distintos: Granite 3B puede servir a desarrolladores individuales y empresas emergentes que ejecuten modelos locales mediante Ollama o LM Studio, mientras que Granite 8B apunta a equipos capaces de operar una GPU moderna.

Granite 30B, por su parte, está dirigido a organizaciones con infraestructura de clase empresarial, como aceleradores A100 o H100, aunque también contempla servicios en FP8 o NVFP8 mediante vLLM. La disponibilidad de los pesos para instalación local puede resultar especialmente relevante para entidades reguladas, que necesitan conservar sus datos dentro de sus propios centros de cómputo y controlar el ciclo de ajuste del modelo.

Entre las industrias identificadas para estos sistemas figuran el desarrollo de software, los servicios financieros, la salud, las telecomunicaciones, el sector público y los centros de contacto. Sus aplicaciones potenciales incluyen agentes de ingeniería de software, automatización de DevOps desde terminales, investigación con buscadores, recuperación aumentada para documentos extensos y llamadas estructuradas a herramientas.

La licencia Apache 2.0 amplía el margen de experimentación para compañías que desean comparar modelos abiertos con servicios propietarios. Sin embargo, la libertad de uso no elimina los costos de infraestructura, evaluación, seguridad y supervisión que exige desplegar agentes capaces de ejecutar acciones sobre sistemas empresariales.

Razonamiento y entrenamiento en entornos reales

Granite 4.2 fue preentrenado desde cero con aproximadamente 15 billones de tokens y utiliza una arquitectura con atención de consultas agrupadas, ocho cabezas de claves y valores, RoPE con theta de 10.000.000, bloques SwiGLU y RMSNorm. Los modelos emplean precisión bfloat16, embeddings de entrada y salida no compartidos, y una longitud de secuencia publicada de 131.072 tokens, equivalente a un contexto de 128K.

El proceso de preentrenamiento incluyó cinco fases, con una etapa de contexto largo que extendió la capacidad de entrenamiento hasta 512K tokens. Esa diferencia entre la fase extendida de entrenamiento y la longitud de secuencia consignada en la tabla arquitectónica muestra que IBM separa el aprendizaje de dependencias muy largas de la configuración principal anunciada para el uso del modelo.

El ajuste supervisado utilizó cerca de 7,2 millones de muestras, equivalentes aproximadamente a 100.000 millones de tokens, de los cuales unos 65.000 millones fueron entrenables. La mezcla estuvo compuesta por 31,6% de datos agénticos y 68,4% de datos no agénticos; dentro del segmento agéntico, la ingeniería de software representó 69%.

IBM generó trayectorias mediante entornos y arneses como OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex y Goose. Para el control de calidad empleó como jueces a GPT-OSS-120B y Gemma 4, además de deduplicación mediante SHA-256 sobre los campos tools y messages, una medida destinada a reducir repeticiones en las conversaciones y acciones de entrenamiento.

El aprendizaje por refuerzo separa a los modelos

La etapa posterior al entrenamiento no consistió en una única pasada de optimización, sino en una cadena de refuerzo con múltiples etapas y entornos. Cada fase correspondió a una ejecución asíncrona de GRPO que partía del punto de control anterior, utilizaba una línea base leave-one-out en lugar de una red de valores y aplicaba muestreo de importancia truncado para limitar la deriva fuera de política.

El orden de trabajo comenzó con RLVR y continuó con potenciadores de habilidades, ingeniería de software, terminal, búsqueda y RLHF. La secuencia combina recompensas verificables con retroalimentación humana y tareas operativas, una estrategia que busca que el modelo no solo produzca una respuesta plausible, sino que complete pasos comprobables en un flujo de trabajo.

La diferencia más importante entre tamaños aparece en el bloque de aprendizaje por refuerzo agéntico. IBM lo aplicó únicamente a Granite 8B y Granite 30B, que aprendieron a editar código, conducir una terminal y ejecutar búsquedas web dentro de entornos aislados; Granite 3B recibió el refuerzo fundacional y la alineación, pero no esas fases agénticas.

La decisión ayuda a explicar por qué las capacidades operativas de los modelos grandes superan ampliamente a las del modelo pequeño, incluso cuando los tres comparten la misma familia arquitectónica. El entrenamiento se ejecutó con NeMo-RL y NeMo-Gym sobre un clúster NVIDIA GB200 NVL alojado por CoreWeave, mientras que IBM añadió un billón de tokens de código sintético generado con su canal CodeAlchemy.

La compañía también incorporó una capa de decodificación especulativa para acelerar la atención durante el servicio. En términos prácticos, el diseño intenta reducir el tiempo necesario para generar respuestas sin cambiar el objetivo central de Granite 4.2: ofrecer modelos abiertos capaces de razonar y utilizar herramientas dentro de procesos empresariales.

Resultados reportados y límites de comparación

Según los resultados publicados por IBM, Granite 30B obtuvo 57,00 en SWE-Bench Verified, frente a 47,67 de Granite 8B; Granite 3B no recibió una puntuación en esa prueba. En Terminal-Bench 2.1, las versiones 8B y 30B alcanzaron 20,56 y 29,24, respectivamente, lo que refleja la ventaja del entrenamiento específico para operar terminales.

En τ³-bench, los resultados fueron 50,99 para 3B, 66,34 para 8B y 68,05 para 30B. En BFCL versión 4, IBM reportó 52,41, 50,29 y 61,39, mientras que las puntuaciones en AIME25 fueron 78,33, 86,67 y 89,17 para las mismas tres versiones.

Las pruebas generales también mostraron una progresión con el tamaño, aunque no idéntica en todos los indicadores. Granite 3B obtuvo 54,80 en GPQA y 67,84 en MMLU-Pro; Granite 8B alcanzó 64,14 y 74,04, y Granite 30B llegó a 66,41 y 77,60, respectivamente.

En la evaluación de contexto largo RULER 128K, los modelos registraron 55,30, 71,41 y 81,38 puntos. Estas cifras son resultados reportados por IBM y deben leerse como mediciones bajo configuraciones concretas, no como una garantía de desempeño uniforme en cada aplicación, conjunto de datos o flujo de trabajo empresarial.

Granite Speech amplía el lanzamiento al audio

Junto con los modelos de lenguaje, IBM liberó dos modelos Granite Speech 5.0 Turbo CTC de 470 millones de parámetros cada uno. Estos sistemas prescinden por completo de una base de modelo de lenguaje y utilizan clasificación temporal conexionista, conocida como CTC, para convertir el audio directamente en texto.

La arquitectura más pequeña busca una ruta especializada para el reconocimiento automático del habla, en lugar de reutilizar un modelo generativo grande para cada transcripción. Esa elección puede interesar a centros de contacto y otras operaciones de alto volumen, donde el costo por procesamiento, la latencia y la capacidad de ejecución local influyen tanto como la calidad lingüística.

IBM reportó un rendimiento cercano a 12.600 veces tiempo real en una sola GPU H200. La compañía comparó esa cifra con aproximadamente 6.000 veces tiempo real para los actuales líderes de velocidad de la tabla de clasificación Open ASR, y también puso a disposición una demostración basada en WebGPU.

El dato de rendimiento corresponde a la medición comunicada por IBM y no sustituye una evaluación independiente con distintos idiomas, ruidos, acentos y condiciones de hardware. Aun así, el lanzamiento muestra que la estrategia de Granite 4.2 no se limita a competir en razonamiento textual, sino que intenta cubrir también componentes especializados de las operaciones empresariales.

Qué significa para las empresas

La combinación de pesos abiertos, razonamiento explícito y entrenamiento en entornos de herramientas puede reducir la distancia entre un chatbot y un sistema operativo para tareas digitales. Un agente basado en Granite 8B o 30B podría, bajo los controles adecuados, proponer cambios de código, ejecutar comandos en una zona aislada y consultar información antes de presentar una solución.

Ese potencial también eleva los riesgos de implementación, porque un modelo con acceso a terminales o buscadores puede causar errores más allá de una respuesta incorrecta. Las empresas tendrán que definir permisos, registrar acciones, revisar resultados y mantener entornos de prueba, especialmente en sectores financieros, sanitarios y públicos donde la trazabilidad resulta esencial.

Para equipos con recursos limitados, Granite 3B ofrece una alternativa local con menor demanda de cómputo y modelos cuantizados GGUF que llegan hasta Q4_K_M. No obstante, la ausencia del bloque de aprendizaje por refuerzo agéntico significa que su desempeño operativo no debe asumirse equivalente al de las versiones mayores, aunque comparta controles de pensamiento y la licencia abierta.

El siguiente desafío será comprobar cómo se comportan Granite 4.2 y Granite Speech fuera de las pruebas publicadas, con datos privados, idiomas regionales y procesos que no fueron diseñados por los autores del entrenamiento. La apertura de los pesos facilita esa comprobación, pero la responsabilidad de validar seguridad, precisión y costos recaerá en cada organización que decida llevarlos a producción.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín