xAI lanza Grok 4.6, un modelo de inteligencia artificial que iguala a GPT-5.6 Sol en el índice AA Intelligence y se enfoca en agentes de larga duración. Disponible en Cursor y Grok Build, incluye mejoras en codificación y trabajo visual, con un precio inicial de USD $2 por millón de tokens de entrada.
***
- Grok 4.6 iguala a GPT-5.6 Sol en el índice AA Intelligence con 61 puntos.
- Disponible en Cursor, Grok Build y API desde USD $2 por millón de tokens de entrada.
- Ofrece mejoras en benchmarks de codificación y agentes, con un enfoque en trabajo interactivo y visual.
xAI presentó hoy, 12 de agosto de 2026, su nuevo modelo Grok 4.6, que llega con un enfoque especial en agentes de larga duración, trabajo interactivo y visual. El anuncio, publicado en el sitio oficial de xAI, destaca que el modelo se basa en Grok 4.5, pero con mejoras significativas en la ejecución de tareas complejas en múltiples pasos.
Grok 4.6 está diseñado para mantener el enfoque en tareas extensas, ya sea investigando un tema, analizando información, trabajando en un codebase o convirtiendo una idea en una aplicación pulida. La compañía subraya que el modelo alcanza inteligencia de vanguardia en varios benchmarks de codificación agéntica y trabajo del conocimiento.
Rendimiento en benchmarks
En el Índice de Inteligencia Artificial Analysis, Grok 4.6 obtuvo 61 puntos, igualando a GPT-5.6 Sol. Este índice es una puntuación compuesta de nueve benchmarks que mide la capacidad general de los modelos.
En GDPVal-AA v2, Grok 4.6 alcanzó 1.753 puntos, superando a GPT-5.6 Sol (1.728) y a Fable 5 (1.741). Este benchmark evalúa la capacidad de los modelos para manejar tareas de validación y razonamiento complejo.
En CursorBench v3.2, obtuvo 69,9%, por encima de GPT-5.6 Sol (67,2%), pero por debajo de Fable 5 (70,5%). Este indicador mide la eficiencia en entornos de código asistido por IA.
En DeepSWE v1.1, Grok 4.6 logró 65,9%, mientras que GPT-5.6 Sol alcanzó 73% y Fable 5 70%. En FrontierCode v1.1 Extended, obtuvo 61,3%, superando a GPT-5.6 Sol (60,6%), pero inferior a Fable 5 (63,6%).
En APEX-Agents, Grok 4.6 consiguió 57,5%, frente al 56,7% de GPT-5.6 Sol y el 59,2% de Fable 5. En Terminal-Bench v3.0, su puntuación fue 26%, muy por debajo del 34,6% de GPT-5.6 Sol y del 34,1% de Fable 5.
En APEX-SWE, obtuvo 56,4%, superando su predecesor (53,6%), pero sin datos de GPT-5.6 Sol y con Fable 5 a la cabeza (58,8%). En AA-Briefcase, lideró con 1.577 puntos, por delante de GPT-5.6 Sol (1.502) y Fable 5 (1.574).
El modelo también destacó en Harvey LAB, un benchmark para agentes legales, donde alcanzó 15,8%, superando ampliamente a GPT-5.6 Sol (2,5%) y a Fable 5 (11,3%). Esta es una de las diferencias más notables frente a la competencia.
Entrenamiento y datos
Grok 4.6 pasó por una ejecución de entrenamiento suplementario más larga que Grok 4.5, utilizando datos generados por modelos curados para razonamiento y conceptos técnicos avanzados. También se incorporaron datos de ingeniería de alta calidad y un optimizador mejorado.
Según xAI, se usó Grok 4.5 para regenerar trayectorias de SFT en esfuerzos de razonamiento, arneses de agentes y dominios como STEM, ingeniería de software y trabajo del conocimiento. Las trayectorias problemáticas se filtraron mediante verificaciones basadas en modelos.
El checkpoint de SFT resultante mostró un rendimiento fuerte y un comportamiento mejorado. Luego, el modelo fue entrenado en una amplia variedad de tareas de RL agénticas, incluyendo trabajo del conocimiento, codificación general, optimización de kernels, desarrollo web y diseño asistido por computadora.
La combinación de estos métodos permitió que Grok 4.6 produzca mejores primeros intentos en proyectos visuales e interactivos que su predecesor. En trayectorias más largas, se observó que el modelo comienza a auto-probarse y verificar su propio trabajo antes de continuar.
Capacidades para agentes
Grok 4.6 es particularmente fuerte en convertir una idea de producto amplia en una primera versión funcional. Puede investigar dominios desconocidos, estructurar la aplicación, implementar interacciones centrales y refinar el resultado a través de varias rondas de retroalimentación.
En la práctica, esto lo hace útil para proyectos donde la ruta más rápida a un buen resultado es comenzar con algo sustancial y luego iterar en el bucle. El modelo también muestra una mayor capacidad para mantener el trabajo a lo largo de muchos pasos sin perder coherencia.
Según los desarrolladores, Grok 4.6 establece estructura y lenguaje visual para una aplicación en una sola pasada, algo que no se veía típicamente con Grok 4.5. Esto ha sido especialmente beneficioso en proyectos de desarrollo web y diseño de interfaces.
La compañía enfatiza que estas mejoras no se limitan al código, sino que también se extienden a la investigación y al análisis de información compleja. Los agentes pueden manejar tareas de larga duración con mayor autonomía y eficiencia.
Disponibilidad y precios
Grok 4.6 está disponible hoy en Cursor y Grok Build. También se ofrece a través de la API y socios como OpenRouter, Vercel y Cloudflare.
El precio comienza en USD $2 por millón de tokens de entrada y USD $6 por millón de tokens de salida. Además, hay una variante rápida que cuesta el doble.
Para celebrar el lanzamiento, xAI ofrece el doble de uso incluido dentro de Grok Build y Cursor durante la primera semana. Esto permite a los usuarios probar 4.6 de inmediato sin costo adicional.
Los interesados pueden crear una clave API en el sitio de SpaceXAI para empezar a construir con el modelo. La documentación completa está disponible en los docs de API.
Seguridad y salvaguardas
Las salvaguardas de Grok 4.6 fueron mejoradas y calibradas en línea con las capacidades del modelo. La pila de seguridad está diseñada para maximizar la utilidad y la seguridad en casos de uso legítimos.
El trabajo de evaluación incluyó la suite más amplia hasta ahora de pruebas previas al despliegue para calibración de capacidades y salvaguardas. También se realizaron extensas pruebas posteriores al despliegue y de terceros.
La compañía señala que Grok 4.6 es útil y seguro en dominios como la corrección de vulnerabilidades, acelerando el ciclo de diseño de ingeniería y aumentando la investigación de IA. Estas capacidades expandidas requirieron un enfoque más riguroso en la evaluación de riesgos.
El anuncio original de xAI no especifica detalles adicionales sobre los métodos de seguridad, pero destaca que los resultados reflejan un balance positivo entre utilidad y protección. En los próximos días se esperan análisis independientes de la seguridad del modelo.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Bitcoin
5 formas de ganar Bitcoin en 2026 sin comprarlo: desde caminar hasta entrenar a la IA
Bancos y Pagos
India quiere que la IA apruebe préstamos que los humanos rechazarían
Empresas
IA descubre vulnerabilidades en Zoom que permitían tomar control del dispositivo
Capital de Riesgo