Google DeepMind presenta DiffusionGemma, un modelo que transforma Gemma 4 en un generador por difusión, logrando 1.500 tokens por segundo. Con entrenamiento reducido, ofrece correcciones en paralelo y un desempeño sorprendente en tareas estructuradas.
***
- DiffusionGemma adapta Gemma 4 a difusión con menos del 10% del entrenamiento original.
- Alcanza 1.500 tokens por segundo y corrige errores en paralelo.
- Su rendimiento es inferior al autoregresivo, pero destaca en velocidad y tareas estructuradas.
🚀💡 Google lanza DiffusionGemma, un modelo que adapta Gemma 4 para generar 1.500 tokens por segundo
Usa menos del 10% del entrenamiento original, mostrando correcciones en paralelo.
Destaca en velocidad y tareas estructuradas, aunque su rendimiento es inferior al modelo… pic.twitter.com/eq4Scrb57y
— Diario฿itcoin (@DiarioBitcoin) August 9, 2026
La inteligencia artificial generativa ha dado un nuevo paso con DiffusionGemma, un modelo de Google DeepMind que demuestra que no es necesario entrenar desde cero para adoptar arquitecturas de difusión en el texto. El equipo adaptó el modelo Gemma 4 existente para convertirlo en un generador por difusión, alcanzando velocidades superiores a los modelos tradicionales.
El informe técnico, publicado recientemente, explica cómo funciona este enfoque y qué sacrificios implica.
El enfoque de difusión en el texto
Los modelos autoregresivos generan texto palabra por palabra, basándose en las anteriores. DiffusionGemma, en cambio, trabaja con bloques de 256 tokens que se refinan simultáneamente, similar a cómo las IAs de imágenes eliminan el ruido de una imagen.
Este método permite que el modelo procese información de manera bidireccional, es decir, que pueda corregir errores en etapas posteriores del refinamiento.
Según el informe, DiffusionGemma alcanza una velocidad de salida de alrededor de 1.500 tokens por segundo en un acelerador Nvidia H100.
Para lograrlo, los investigadores no partieron de cero, sino que adaptaron el modelo Gemma-4-26B-A4B ya existente, utilizando menos del 10% del presupuesto original de tokens de entrenamiento.
Esta estrategia reduce costos computacionales y acelera el tiempo de desarrollo.
Dos etapas de entrenamiento: reconstrucción y refinamiento con RL
El proceso de entrenamiento se divide en dos fases principales. En la primera, el modelo aprende a reconstruir bloques de texto ruidosos a partir de datos de ejemplo.
La segunda fase combina aprendizaje por refuerzo y destilación de muestreadores, denominada SD·RL.
El aprendizaje por refuerzo suele mejorar la calidad de las respuestas, mientras que la destilación reduce los pasos de cómputo necesarios.
Google fusiona ambos en un solo proceso para equilibrar velocidad y precisión.
Según el informe, este enfoque combinado eleva la calidad en los puntos de referencia de razonamiento en un promedio de 10 puntos.
Además, casi cuadruplica la cantidad de tokens por paso de cómputo, y las respuestas resultan alrededor de un 50% más cortas.
Razonamiento bidireccional: la capacidad de autocorregirse
Una de las ventajas más notables es la capacidad de corregir errores durante la generación. Los modelos autoregresivos se comprometen con el primer token, mientras que DiffusionGemma puede revisar y ajustar el texto mientras refina los bloques.
Por ejemplo, en un problema matemático, Gemma 4 comienza con “-1” y luego corrige a “-25” después de reflexionar. DiffusionGemma, en cambio, desarrolla la respuesta y el razonamiento en paralelo, evitando correcciones tardías.
Esta propiedad también permite resolver tareas que dependen de información futura, como los sudokus.
Tras un ajuste fino mínimo, DiffusionGemma resuelve correctamente cerca del 85% de los rompecabezas, mientras que el modelo base falla por completo.
Las salidas estructuradas como JSON o reparaciones de código se completan después de solo dos o tres pasos de refinamiento, ya que la entrada determina la mayoría de los tokens.
Resultados y compensaciones frente a Gemma 4
A pesar de sus ventajas de velocidad, el rendimiento absoluto de DiffusionGemma es inferior al del modelo autoregresivo original, Gemma 4.
Google señala varias razones: no fue entrenado como modelo de difusión desde el principio, la fase de entrenamiento posterior fue corta, y SD·RL priorizó la velocidad sobre la calidad máxima.
La arquitectura y los datos de entrenamiento se trasladaron del modelo Gemma 4 original, que no son necesariamente ideales para la difusión.
El modelo ocasionalmente se queda atrapado en bucles de repetición, produciendo palabras individuales varias veces seguidas.
Esto es un artefacto de los pasos de cómputo drásticamente reducidos.
En tareas multimodales, DiffusionGemma a veces olvida cerrar correctamente su sección de razonamiento, lo que arrastra hacia abajo las puntuaciones de los puntos de referencia.
Limitaciones y escenarios de uso
La ventaja de velocidad se mantiene principalmente en escenarios de usuario único. Una vez que alrededor de 32 solicitudes concurrentes llegan al modelo, los modelos de lenguaje estándar alcanzan el mismo rendimiento en cuanto a capacidad de procesamiento.
Google llama explícitamente a DiffusionGemma un modelo experimental y dice que el lanzamiento tiene como objetivo acelerar la investigación sobre difusión de texto.
El modelo ya está siendo utilizado por la startup Interfaze para el reconocimiento de voz multilingüe y en un proyecto de investigación sobre generación interactiva de informes de radiología.
Este enfoque de adaptación de modelos existentes podría inspirar a otros equipos a experimentar con difusión sin los costos de un entrenamiento completo.
Además, DiffusionGemma conserva la capacidad original de generar texto palabra por palabra, lo que permite a los usuarios alternar entre modos según la tarea.
La disponibilidad bajo licencia Apache 2.0 en Hugging Face facilita el acceso a la comunidad.
Disponibilidad y futuro
DiffusionGemma se suma a la tendencia de modelos híbridos que combinan diferentes arquitecturas para optimizar la eficiencia.
Su predecesor, Gemini Diffusion, fue demostrado por Google en mayo de 2025, lo que indica una línea de investigación activa.
El hecho de que no se requiera entrenar desde cero abre puertas para aplicaciones más accesibles en términos de recursos.
Aún quedan desafíos por resolver, como la calidad en tareas complejas y la estabilidad en generación extensa.
Sin embargo, el avance de DiffusionGemma demuestra que la difusión de texto es viable y competitiva en ciertos casos de uso.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
Nanorobot modular de Basilea: un cohete microscópico contra el cáncer
Criptomonedas
M&A cripto rompe récord de USD $9.66 mil millones, pero los acuerdos caen un 25%
Bitcoin
Strategy anuncia plan de acciones preferentes respaldadas por Bitcoin por USD $15.000 millones
Empresas