GPT-6 Astra se convirtió en el primer modelo probado por DrivingBench en completar un recorrido real entre conos, pero lo hizo a paso de caracol, con supervisión humana y un costo de inferencia muy superior al de la gasolina.
***
- GPT-6 Astra recorrió 134,7 metros en 5 minutos y 22 segundos durante su segundo intento.
- El experimento consumió 6,6 millones de tokens y costó USD $7,74, sin contar el hardware de USD $999.
- Los investigadores advierten que la latencia, el precio y la necesidad de un conductor listo para frenar impiden usar hoy un modelo frontera sin ajustes.
🚗🤖 GPT-6 Astra completa una prueba de conducción
Recorrió 134,7 m en 5:22, con supervisión humana.
Consumió 6,6 millones de tokens y USD 7,74: unos USD 92,47 por milla, sin hardware ni gasolina.
DrivingBench reportó límites de latencia y costo. pic.twitter.com/qa6aXKsNvp
— Diario฿itcoin (@DiarioBitcoin) September 24, 2026
GPT-6 Astra, el modelo insignia de OpenAI, completó por primera vez el recorrido de conducción diseñado por el proyecto DrivingBench, una prueba realizada en un estacionamiento con un Toyota Corolla y varios conos. El logro llegó en el segundo intento, después de que otros modelos comerciales, entre ellos GPT-5.6 Sol, Grok 4.6 y Claude Fable 5.1, no consiguieran terminar la pista. El resultado demuestra una capacidad llamativa de percepción y planificación, aunque todavía está muy lejos de representar una alternativa práctica para conducir en calles abiertas.
Durante la prueba, Astra recorrió 134,7 metros en 5 minutos y 22 segundos, lo que equivale a una velocidad promedio de apenas 0,94 millas por hora. Los investigadores Tobias Gessler, Aditya Ramabadran y Simon Mahns registraron el resultado como el único recorrido completamente terminado dentro de la serie de intentos analizados. El vehículo operó bajo condiciones extremadamente controladas, con velocidades muy bajas y una persona preparada para intervenir en todo momento.
Según The Register, el experimento forma parte de DrivingBench, un proyecto que somete modelos comerciales de inteligencia artificial a tareas de conducción física para medir cómo interpretan imágenes, planean maniobras y controlan un automóvil. Los resultados anteriores habían sido poco alentadores: la mayoría de los intentos no superó la primera curva, mientras que el tercer intento de Claude Fable 5.1 llegó aproximadamente a la mitad del recorrido. La principal dificultad fue identificar de qué lado de la primera línea diagonal de conos se encontraba el carril correcto.
Un recorrido corto con una factura enorme
Para completar el trayecto, los investigadores gastaron USD $7,74 en inferencia y utilizaron aproximadamente 6,6 millones de tokens. El cálculo equivale a cerca de USD $1,17 por millón de tokens, una cifra considerablemente inferior a las tarifas publicadas de OpenAI, que contemplan USD $10 por millón de tokens de entrada y USD $50 por millón de tokens de salida. La diferencia se explica principalmente por el uso de caché durante la conversación con el modelo.
Aditya Ramabadran, miembro del personal técnico de Axiom Math, explicó que la aplicación reenviaba en cada turno toda la conversación, incluidas las imágenes, de modo que casi todos los tokens correspondían a contexto repetido y se facturaban como entrada en caché. Esa modalidad tenía un costo de USD $1 por millón de tokens, en lugar de USD $10, mientras el modelo generaba muy poco texto: pequeñas llamadas a herramientas y algunas frases de salida o razonamiento. En este caso, la eficiencia tarifaria no evitó que el volumen total de procesamiento resultara extraordinario frente a la distancia recorrida.
El gasto tampoco terminó con la factura de la API. El equipo utilizó un dispositivo de asistencia al conductor comma four, con un precio de USD $999, que ejecuta el software openpilot y se conecta a un portátil y al automóvil mediante el bus CAN; además, empleó un teléfono móvil comunicado con los servidores de xAI que alojaban GPT-6 Astra. Si se distribuye el costo de los tokens entre los 134,7 metros recorridos, la operación representa aproximadamente USD $92,47 por milla, sin sumar el hardware, la gasolina ni otros costos operativos.
La comparación con un automóvil convencional deja en evidencia la brecha económica. Un vehículo con rendimiento de 25 millas por galón y gasolina a USD $4,60 por galón tendría un costo de combustible cercano a USD $0,184 por milla, por lo que los tokens del experimento resultaron unas 500 veces más caros. Esa cuenta todavía excluye el seguro, que podría no cubrir a un sistema de inteligencia artificial como conductor, y tampoco incorpora el costo de mantener a una persona lista para frenar durante toda la maniobra.
La seguridad también condicionó la prueba
Los modelos no siempre aceptaron conducir el automóvil físico, incluso después de recibir instrucciones sobre las medidas de seguridad y aunque la pista estuviera en un estacionamiento completamente vacío. El informe señala que algunos sistemas, especialmente GPT-6 Astra, se negaban a actuar porque interpretaban la tarea como una actividad riesgosa. En ciertas pruebas, los modelos observaron las imágenes reales, comprendieron que no se trataba de una simulación y comenzaron a reaccionar con alarma.
Para evitar esas negativas, los investigadores describieron el ejercicio como una simulación, aunque el vehículo efectivamente se desplazaba en un entorno físico. También cambiaron el nombre de su servidor MCP a DrivingBench Sandbox, una modificación que resultó suficiente para convencer a los modelos de que no estaban operando en carreteras reales. La estrategia muestra una tensión relevante: el sistema podía reconocer riesgos de seguridad, pero los experimentadores tuvieron que reformular el contexto para conseguir que ejecutara las órdenes.
Ramabadran sostuvo que utilizar hoy un modelo frontera sin ajustes para la conducción real definitivamente no resulta práctico. El automóvil estaba limitado a velocidades muy bajas y contaba con un humano preparado para frenar, mientras que la latencia de la conexión y el tiempo de razonamiento del modelo se convirtieron en cuellos de botella. En una de las pruebas, Claude Fable 5.1 condujo durante solo 31 de 190 segundos y pasó el resto del tiempo detenido mientras procesaba la situación.
GPT-6 Astra consultaba la herramienta observe, que le permitía examinar las vistas de la cámara, aproximadamente cada cinco o seis segundos. Ese intervalo puede parecer suficiente en un estacionamiento despejado y con una velocidad inferior a una milla por hora, pero plantea limitaciones evidentes cuando el entorno cambia con rapidez o exige una maniobra inmediata. Aun así, los investigadores se mostraron sorprendidos de que un modelo de propósito general pudiera completar un recorrido físico bajo esas restricciones.
Los modelos especializados aún llevan ventaja
El resultado no desplaza a los sistemas diseñados específicamente para vehículos autónomos. Ramabadran afirmó que, por ahora y durante el futuro cercano, esos modelos especializados seguirán siendo preferibles porque son más rápidos, más baratos y acumulan más pruebas en condiciones reales. Además, los modelos frontera como Astra todavía dependen de GPU de centros de datos para ejecutar la inferencia, una arquitectura poco adecuada para responder de forma autónoma dentro de un automóvil.
Una posible ruta de desarrollo consistiría en entrenar primero un modelo general de gran capacidad y luego destilarlo en un sistema especializado más pequeño. Ese modelo reducido tendría que caber en el hardware del vehículo y funcionar con suficiente eficiencia para responder sin depender continuamente de una conexión externa. La propuesta se relaciona con la llamada Lección Amarga de la inteligencia artificial, según la cual los métodos generales que aprovechan el aumento sostenido del poder de cómputo tienden a imponerse a largo plazo.
Los resultados de DrivingBench ofrecen algunos indicios favorables para esa hipótesis, porque los modelos probados probablemente no fueron entrenados específicamente para conducir automóviles reales y aun así demostraron capacidades útiles. Su desempeño combinó percepción, razonamiento, planificación y control adquiridos en otras tareas mediante el escalamiento de los modelos. Sin embargo, el experimento también confirma que esas habilidades generales no sustituyen por sí solas la velocidad, la confiabilidad y la validación que exige la conducción autónoma.
El contraste con Waymo ayuda a dimensionar la diferencia entre una demostración llamativa y un sistema comercial. Según una estimación citada en el reporte, Google habría gastado entre USD $35.000 millones y USD $40.000 millones en Waymo desde el inicio del proyecto de vehículos autónomos en 2009, incluyendo una estimación de USD $30.000 millones para 2024 y las pérdidas posteriores. En febrero de 2026, Waymo anunció además una ronda de inversión de USD $16.000 millones, con una valoración posterior a la inversión de USD $126.000 millones. Frente a esa inversión en tecnología a medida, delegar la conducción a Claude, ChatGPT o Copilot mediante hardware modesto todavía pertenece a una posibilidad futura, no a una solución lista para las carreteras.
El experimento deja una conclusión doble: un modelo general puede superar una prueba física sencilla, pero el éxito ocurre bajo condiciones tan favorables que no elimina los riesgos técnicos ni económicos. La conducción autónoma seguirá dependiendo de sistemas especializados hasta que los modelos pequeños reduzcan su latencia, sus necesidades de cómputo y su costo sin sacrificar seguridad.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Google acelera Gemini 4 ante la presión de OpenAI y Anthropic
China
DeepSeek alcanza una tasa anualizada de ingresos de USD $1.000 millones
Empresas
Meta proyecta un gasto de capital de hasta USD $145.000 millones durante 2026
Estados Unidos
