Inkling, el primer modelo de Thinking Machines, llega con pesos abiertos, licencia Apache 2.0 y un desempeño destacado en agentes, aunque sus pruebas prácticas revelan límites importantes.
***
- Inkling utiliza una arquitectura de mezcla de expertos con 975.000 millones de parámetros, 41.000 millones activos y una ventana de contexto de 1 millón de tokens.
- El modelo alcanzó 74,1% en MCP Atlas y 77,6% en SWE-Bench Verified, por encima de Nemotron 3 Ultra de Nvidia.
- Sus fallas en codificación, lógica, creatividad y censura reducen su atractivo frente a modelos chinos más baratos y alternativas pequeñas.
Mira Murati presentó Inkling después de dedicar dos años a construir una nueva propuesta tras su salida de OpenAI. El modelo es el primer lanzamiento del laboratorio Thinking Machines, creado por la ejecutiva.
La revisión publicada por Tech Yahoo lo describe como el mejor modelo de código abierto entrenado desde cero por un laboratorio occidental. Esa valoración responde tanto a sus capacidades como al retroceso de los desarrolladores occidentales frente a los modelos abiertos de China.
El lanzamiento de Mistral en abril llegó a un mercado dominado en los primeros puestos por Qwen, de Alibaba, GLM, de Z.ai, y Kimi, de Moonshot AI. Nemotron, de Nvidia, era el único representante occidental en la tabla mencionada, pero no figuraba como un modelo de vanguardia.
Inkling llega sin restricciones regionales y publica sus pesos completos en Hugging Face bajo la licencia Apache 2.0. Esto permite que empresas y desarrolladores estudien, adapten e integren el modelo con mayor libertad jurídica.
La propuesta, sin embargo, no equivale a una revolución generalizada. El análisis sostiene que Inkling tiene un espacio concreto en organizaciones que necesitan un sistema abierto occidental, pero no necesariamente en todos los flujos de trabajo de inteligencia artificial.
Una arquitectura enorme con acceso relativamente económico
Inkling utiliza una arquitectura de mezcla de expertos, conocida como mixture of experts. El sistema suma 975.000 millones de parámetros, aunque activa 41.000 millones durante la inferencia.
Los parámetros funcionan como los ajustes internos que el modelo utiliza para procesar información. Los tokens, en cambio, representan las unidades básicas de texto, imágenes o audio que una inteligencia artificial puede leer y generar.
El modelo procesa texto, imágenes y audio, y admite una ventana de contexto de 1 millón de tokens. Además, fue preentrenado con 45 billones de tokens, una escala que exige recursos computacionales muy superiores a los de un equipo doméstico.
Por esa razón, el análisis concluye que los usuarios no ejecutarán Inkling localmente en condiciones normales. La combinación de tamaño, infraestructura y necesidades de memoria lo sitúa claramente en el entorno de centros de datos.
En OpenRouter, Inkling tiene un precio de USD $1 por millón de tokens de entrada y USD $4,05 por millón de tokens de salida. Las configuraciones de Hermes, OpenClaw o cualquier pila compatible pueden enrutar sus solicitudes hacia el modelo sin una integración adicional.
Agentes y programación muestran resultados opuestos
La principal fortaleza de Inkling aparece en el uso de herramientas para agentes. MCP Atlas mide la proporción de tareas reales que un agente completa de forma confiable mediante el estándar Model Context Protocol.
Inkling obtuvo 74,1% en esa evaluación, casi 30 puntos porcentuales por encima de Nemotron 3 Ultra de Nvidia. Ese resultado lo convierte en una alternativa relevante para flujos de trabajo que dependen de herramientas y acciones automatizadas.
En SWE-Bench Verified, una prueba que mide la corrección autónoma de problemas en GitHub, alcanzó 77,6%. Nemotron registró 70,7% en la misma evaluación.
La imagen cambia cuando se examina la codificación compleja. Una prueba extensa para crear un videojuego de zombis terminó con una pantalla en blanco, por lo que el aviso original tuvo que simplificarse.
Con un aviso de 99 palabras, Inkling produjo un juego funcional, aunque limitado. Los enemigos eran rectángulos y esferas, faltaban un fondo y una pantalla de juego visible, pero la lógica de tipeo, las pulsaciones y el registro de entradas funcionaron correctamente.
El sistema también tomó decisiones interesantes sobre el movimiento de los enemigos. Las criaturas avanzaban constantemente hacia el jugador, en lugar de permanecer estáticas, aunque el supuesto sistema de oleadas terminó convertido en un flujo continuo.
La comparación con Bonsai 27B resultó especialmente desfavorable para Inkling. El modelo basado en Qwen3.6 ocupa 3,9 GB y puede funcionar en un teléfono, pero entregó un resultado de codificación más completo y satisfactorio.
La prueba no demuestra que Inkling sea inferior en todas las tareas. Sí plantea una pregunta relevante sobre la relación entre sus 975.000 millones de parámetros y el rendimiento práctico que obtiene el usuario.
Creatividad y razonamiento aún tienen límites
La evaluación de creatividad asociativa pidió al modelo conectar una rama, la explotación proletaria y una lechuga. Inkling comenzó con una metáfora sólida sobre la rama despojada de corteza y la pérdida de identidad histórica de un trabajador.
También produjo imágenes llamativas, como la idea de que el viento funciona como un gerente invisible que decide si el movimiento resulta rentable. La frase final de esa sección fue: “No ves a una persona romper; ves a una rama caer. Y la caída se llama ‘eficiencia’”.
La calidad disminuyó al abordar la lechuga. Frases como “La lechuga no recuerda la rama. La lechuga no necesita hacerlo” intentaron cerrar la metáfora, pero no construyeron una relación estructural convincente entre los conceptos.
La prueba de lógica utilizó una variante del rompecabezas del puente y la antorcha. Cuatro personas con tiempos de 1, 2, 5 y 10 minutos debían cruzar el puente con una antorcha, y el modelo respondió 17 minutos.
El análisis considera que la respuesta correcta era 10 minutos porque el aviso no establecía que solo dos personas pudieran estar sobre el puente. Las cuatro personas podían cruzar juntas al ritmo de quien tardaba 10 minutos.
El razonamiento interno visible comenzó con la solución clásica de 17 minutos antes de revisar las condiciones específicas. Eso sugiere que el modelo recuperó una respuesta conocida para un problema distinto, en lugar de analizar la formulación presentada.
Inkling no fue el único sistema que falló. Claude Fable 5 y GPT-5.6 Sol también eligieron el marco familiar, lo que llevó a los evaluadores a crear una prueba más difícil porque el ejercicio anterior se había vuelto demasiado sencillo.
Censura, privacidad y escritura creativa
Inkling afirma ofrecer una experiencia completamente privada incluso desde la interfaz de Thinking Machines. Ese elemento puede interesar a organizaciones que manejan información sensible y buscan limitar la exposición de sus datos.
El modelo también mostró una política de seguridad estricta. Rechazó una solicitud sobre cómo coquetear con la esposa de un mejor amigo y otra de una persona con adicción a la heroína que buscaba explicar una ausencia laboral sin perder su empleo.
El segundo caso generó críticas porque la persona mencionaba una adicción grave y cuatro dependientes. La revisión sostiene que ayudarle a conservar su trabajo podía reducir el daño para sus hijos, pero Inkling priorizó la política contra el engaño continuo.
Los modelos abiertos suelen enfrentar la censura mediante procesos de abliteración. Estas técnicas buscan eliminar parte del entrenamiento de seguridad directamente desde los pesos del modelo.
Sin embargo, modificar Inkling exigiría recursos importantes debido a su enorme tamaño. La revisión considera que alternativas más pequeñas, baratas y con mejor rendimiento en varias tareas ofrecen una razón limitada para emprender ese esfuerzo.
La escritura creativa mostró una combinación diferente de fortalezas y fallas. Inkling investigó en la web antes de redactar un relato sobre Jose Lanz, un viajero temporal que se desplazaba desde 2150 hasta el año 1000.
El modelo produjo una prosa sensorial y un mundo inventado atractivo. También se acercó al bucle filosófico solicitado, en el que las acciones del viajero terminaban creando las condiciones de la época futura de la que intentaba escapar.
El problema apareció en la precisión histórica y biográfica. Inkling investigó rutas comerciales del año 1000, pero inventó una herencia filipino-mexicana para un escritor venezolano y mezcló rutas comerciales inexistentes con otros errores.
Un modelo especializado, no un conductor diario
La conclusión de la revisión presenta a Inkling como el mejor modelo abierto lanzado por un laboratorio occidental, aunque también como una herramienta cuyo techo resulta visible. No domina de forma contundente la mayoría de las pruebas examinadas.
Su desempeño en MCP Atlas constituye el argumento más fuerte a favor del sistema. Con 74,1%, puede encajar en pipelines empresariales que necesiten agentes capaces de utilizar herramientas bajo el estándar Model Context Protocol.
La licencia Apache 2.0 amplía su atractivo para los equipos legales y técnicos de compañías. El acceso mediante OpenRouter también simplifica la incorporación en sistemas existentes, con un costo de USD $1 por millón de tokens de entrada y USD $4,05 por millón de tokens de salida.
La situación es menos favorable para desarrolladores que priorizan la codificación por dólar, la salida sin censura o los resultados brutos en benchmarks. En esas áreas, la revisión señala que modelos chinos y alternativas más pequeñas mantienen ventajas importantes.
El caso de Bonsai 27B resume esa tensión. Un modelo de 27.000 millones de parámetros que funciona en un iPhone produjo un videojuego más completo que Inkling en una prueba específica de programación.
Eso no invalida la arquitectura de Thinking Machines ni sus resultados en agentes. Sí demuestra que una escala mayor no garantiza por sí sola una mejor experiencia en cada tarea.
Inkling representa un avance estratégico porque demuestra que un laboratorio occidental puede entrenar desde cero un modelo abierto y modificable. Su importancia para la competencia de largo plazo puede ser mayor que su utilidad inmediata para el usuario promedio.
Por ahora, el caso de uso más claro está en organizaciones que necesitan una alternativa occidental por razones de cumplimiento y no pueden dirigir sus cargas de trabajo hacia Beijing. Para los demás, Inkling parece una herramienta especializada, no un conductor diario.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
billonarios
Elon Musk asegura que el dinero dejará de importar en 2036: la IA transformará la economía
Estados Unidos
ChatGPT habría entregado guías detalladas para crear venenos y armas biológicas
Empresas
Monday.com se suma a 20 tecnológicas que anuncian despidos citando la IA
Estados Unidos