Un proyecto independiente combina ZLUDA con ROCm para ejecutar varias bibliotecas CUDA en una Radeon RX 9060 XT con Windows, aunque las limitaciones de cuDNN, TensorRT y NCCL impiden considerarlo una solución de producción.
***
- Un kit de PowerShell conecta ZLUDA con HIP SDK y ROCm para traducir cargas CUDA en Windows.
- La Radeon RX 9060 XT ejecutó una red PPO de 2,2 millones de parámetros, con 13.278,46 pasos por segundo de mediana.
- cuDNN, TensorRT y NCCL todavía no funcionan, por lo que la compatibilidad depende de cada aplicación.
🚀 CUDA en una Radeon con Windows
Un proyecto combina ZLUDA, HIP SDK y ROCm para ejecutar bibliotecas CUDA en una RX 9060 XT.
La prueba entrenó una red PPO a 13.278 pasos/s.
cuDNN, TensorRT y NCCL aún no funcionan: compatibilidad experimental, no producción. pic.twitter.com/M8x1xICgae
— Diario฿itcoin (@DiarioBitcoin) September 14, 2026
Un desarrollador independiente demostró que es posible ejecutar determinadas cargas de trabajo diseñadas exclusivamente para CUDA en una GPU AMD con Windows, sin recurrir a virtualización ni a un arranque dual. El proyecto, denominado CUDA-for-AMD-Windows y desarrollado por Speedstu, utiliza una combinación automatizada de ZLUDA, HIP SDK y ROCm para traducir varias bibliotecas de NVIDIA hacia sus equivalentes en hardware Radeon.
La prueba llega en un momento en que AMD ha ampliado el soporte oficial de PyTorch y HIP SDK para GPU de consumo en Windows, incluidas las familias Radeon RX 7000 y RX 9000. Sin embargo, ese respaldo nativo no resuelve el problema de las aplicaciones propietarias, repositorios antiguos y herramientas de inteligencia artificial que exigen CUDA como requisito fijo, una dependencia que durante años ha limitado las alternativas de los usuarios de AMD.
Un puente experimental entre CUDA y ROCm
CUDA es la plataforma de computación paralela de NVIDIA y sostiene buena parte del ecosistema utilizado para inteligencia artificial, aprendizaje automático y cálculo científico. Aunque AMD ofrece ROCm y su propia capa de programación HIP, trasladar una aplicación de un entorno a otro puede exigir cambios en el código, ajustes de dependencias y soporte específico por parte de sus desarrolladores.
El proyecto de Speedstu no crea un nuevo entorno de ejecución completamente independiente, sino que organiza mediante scripts de PowerShell una cadena reproducible de herramientas ya existentes. El kit detecta la arquitectura de la GPU, descarga una versión fijada de ZLUDA, identificada como v6-preview.69, y trata de enlazar sus componentes con las bibliotecas matemáticas de ROCm disponibles en Windows.
ZLUDA funciona como una capa de traducción capaz de interceptar llamadas asociadas con CUDA y dirigirlas hacia interfaces compatibles con hardware que no utiliza la arquitectura de NVIDIA. En esta implementación, la API del controlador de CUDA y las bibliotecas cuBLAS, cuSPARSE y cuFFT lograron conectarse con sus equivalentes de AMD, aunque el resultado no representa compatibilidad universal con cualquier programa.
La demostración práctica utilizó una Radeon RX 9060 XT, que según la documentación del proyecto es la única GPU compatible oficialmente por ahora. En esa tarjeta, el desarrollador entrenó de principio a fin una red de aprendizaje por refuerzo PPO con 2,2 millones de parámetros, utilizando bibliotecas CUDA sin modificar como prueba de que la traducción puede funcionar en una carga real.
Rendimiento y límites de la demostración
Las mediciones publicadas compararon dos configuraciones para la misma carga de aprendizaje por refuerzo. La ruta pública basada en versiones oficiales de ZLUDA y en HIP SDK 6.4 de AMD alcanzó una mediana de 13.278,46 pasos por segundo, mientras que una superposición personalizada construida con binarios heredados recuperados de ZLUDA llegó a 12.875,80 pasos por segundo.
La alternativa personalizada fue aproximadamente un 3,03% más lenta en la métrica general de mediana y registró una media de 12.649,83 pasos por segundo, frente a 13.172,49 de la configuración pública. En la recolección, la diferencia mediana fue de 6,23%, con 63.306,00 pasos por segundo para la ruta pública y 59.360,67 para la variante recuperada.
El resto de las pruebas mostró que la configuración personalizada también tuvo desventajas en consumo e inferencia, aunque con magnitudes distintas. La mediana de pasos por segundo de consumo fue de 16.806,36 frente a 16.445,66, el tiempo de inferencia subió de 0,5863 a 0,6293 segundos y el aprendizaje PPO pasó de 3,2076 a 3,2958 segundos.
Tom’s Hardware destacó que el propio desarrollador atribuye parte del margen de mejora a una reescritura posterior que eliminó LibTorch y ZLUDA de PPO, con un rendimiento sustancialmente mayor. Ese detalle sugiere que la capa de traducción puede introducir una penalización relevante, incluso cuando una aplicación consigue ejecutarse correctamente en la GPU de AMD.
Compatibilidad todavía lejos de ser universal
El principal límite del experimento está en las bibliotecas que aún no funcionan. cuDNN, TensorRT y NCCL, componentes importantes para entrenamiento, inferencia y comunicación entre GPU, permanecen fuera del alcance de esta configuración, por lo que una herramienta que dependa intensivamente de cualquiera de ellos puede fallar aunque cuBLAS, cuSPARSE y cuFFT estén disponibles.
La consecuencia práctica es que la compatibilidad debe evaluarse aplicación por aplicación, y no a partir de la simple instalación del paquete. Un repositorio experimental podría iniciar y completar parte de sus tareas, mientras otro programa con dependencias más profundas en el ecosistema CUDA podría detenerse durante la carga, la compilación o el entrenamiento.
El proyecto también debe considerarse una herramienta para entusiastas, no una estrategia de implementación empresarial. La documentación presenta una solución abierta y automatizada, pero su alcance depende de una GPU específica, de versiones concretas de los componentes y de un proyecto de traducción que no ofrece las garantías operativas de una plataforma comercial con soporte formal.
Además, ZLUDA atraviesa una etapa de mantenimiento comunitario después de perder su respaldo comercial por segunda vez y ser descrito como un proyecto de pasatiempo de fin de semana. Esa situación no invalida la demostración, pero sí eleva el riesgo de depender de ella para sistemas críticos, flujos de trabajo productivos o despliegues que necesiten actualizaciones previsibles.
Una oportunidad para el ecosistema de AMD
A pesar de los obstáculos, el experimento aporta una señal relevante para los desarrolladores que utilizan Windows como sistema principal. La barrera para ejecutar software exclusivo de CUDA en una GPU AMD no parece estar únicamente en el hardware, sino también en la disponibilidad de capas de traducción capaces de resolver llamadas, bibliotecas y dependencias concretas.
El enfoque resulta especialmente atractivo para quienes desean probar herramientas de inteligencia artificial sin modificar el repositorio original ni esperar a que su autor publique un puerto para HIP. También ofrece una alternativa frente a configuraciones con WSL2 y passthrough, que pueden añadir complejidad cuando el usuario solo quiere experimentar en su equipo cotidiano.
Tom’s Hardware señaló que el carácter abierto del repositorio podría permitir una detección de hardware más amplia y correcciones para otras bibliotecas CUDA. Esa posibilidad dependerá de que la comunidad aporte parches, reproduzca las pruebas y documente qué aplicaciones funcionan, qué errores aparecen y qué componentes siguen bloqueando la compatibilidad.
Por ahora, CUDA-for-AMD-Windows debe entenderse como una prueba de concepto prometedora, no como el fin del dominio de NVIDIA en cargas de inteligencia artificial. La Radeon RX 9060 XT ya puede ejecutar una selección de bibliotecas y una red PPO bajo Windows, pero la ausencia de cuDNN, TensorRT y NCCL mantiene abierta la brecha entre una demostración técnica y una plataforma lista para producción.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Insiders de empresas públicas vendieron 10 veces más acciones de las que compraron en agosto
Biohacking
Antagonizar la hormona del crecimiento ralentizó el envejecimiento en ratones
Estados Unidos
La ONU exige frenar la carrera de la IA ante riesgos sin precedentes
Blockchain

