- Implementa un sistema de difusión discreta que genera bloques de 256 tokens en paralelo para maximizar la GPU local.
- Se basa en la arquitectura MoE de Gemma 4 con 26 mil millones de parámetros, optimizando el uso de VRAM.
- Es un modelo multimodal capaz de procesar texto, imágenes y vídeo para generar respuestas textuales.
- Ofrece una velocidad de inferencia disruptiva, superando los 1.000 tokens por segundo en hardware de alta gama.

Google ha decidido lanzar al ruedo, sin hacer demasiadas leaderboard ni ruido mediático, una herramienta que promete dar un vuelco a cómo interactuamos con la IA en casa: DiffusionGemma. No se trata de intentar batir en potencia bruta a los gigantes cerrados como Claude o GPT, sino de proponer un camino alternativo donde la velocidad de respuesta en hardware local sea la absoluta prioridad, dejando atrás el método tradicional de escribir palabra por palabra.
Este modelo de pesos abiertos se presenta como una opción ideal para quienes montan sus propias estaciones de trabajo o usan GPUs de consumo, ya que aprovecha la capacidad de procesamiento en paralelo de una forma brutal. Aunque Google admite que hay una ligera bajada en la calidad comparada con el modelo autorregresivo de Gemma 4, la ganancia en fluidez e interactividad es tan bestial que se convierte en una propuesta súper atractiva para desarrolladores y entusiastas.
Un cambio de paradigma: de la máquina de escribir a la imprenta
Para entender qué hace especial a este modelo, primero hay que saber que la mayoría de las IA actuales funcionan como una máquina de escribir: generan un token y luego el siguiente, de izquierda a derecha. En la nube esto no importa mucho porque hay miles de peticiones procesándose a la vez, pero cuando lo ejecutas en tu propio PC, tu tarjeta gráfica se queda esperando la siguiente instrucción, desperdiciando potencia.
DiffusionGemma rompe este esquema utilizando la difusión discreta de texto. En lugar de ir token a token, el sistema crea un lienzo con 256 tokens aleatorios y los va refinando mediante un proceso iterativo de reducción de ruido. Es, literalmente, como si pasáramos de una máquina de escribir a una imprenta masiva que estampa bloques completos de texto simultáneamente, optimizando al máximo el uso de los núcleos tensor de la GPU.
Este enfoque permite que el modelo tenga una visión bidireccional. Mientras que los modelos tradicionales solo miran hacia atrás, DiffusionGemma puede analizar todo el bloque de texto que está generando en ese momento. Esto le permite corregir errores sobre la marcha y resolver problemas complejos donde la respuesta final depende de elementos que aparecen al principio y al final del párrafo, algo que a las IA convencionales les cuesta horrores.
Arquitectura técnica y eficiencia MoE
El corazón de este modelo es la arquitectura de Mezcla de Expertos (MoE) heredada de Gemma 4. Cuenta con un total de 25.200 millones de parámetros, pero lo ingenioso es que solo activa unos 3.800 millones durante la inferencia. Gracias a este diseño disperso, el modelo puede ofrecer un razonamiento profundo sin que el consumo de memoria se dispare, siendo capaz de ajustarse a los límites de 18 GB de VRAM de las tarjetas gráficas comerciales cuando se aplica la cuantización.
En cuanto a sus especificaciones técnicas, destaca una ventana de contexto impresionante de hasta 256.000 tokens y el soporte para el formato BF16 y cuantización NVFP4. El proceso de generación se divide en dos fases: el codificador procesa la instrucción inicial y crea una caché de claves y valores (KV), y luego el decodificador aplica la atención bidireccional sobre el lienzo para limpiar el ruido y dar sentido al texto.
Para que los usuarios saquen el máximo partido, Google recomienda una configuración de muestreo específica. Esto incluye un máximo de 48 pasos de reducción de ruido y un programa de temperatura lineal que baja de 0.8 a 0.4. Esta estrategia permite que el modelo explore ideas al principio y luego bloquee los tokens finales con mayor seguridad, garantizando que la respuesta sea coherente y no se descarrile.
Capacidades multimodales y razonamiento
No se trata solo de texto; DiffusionGemma es un modelo nativamente multimodal. Puede digerir entradas de texto, imágenes con resolución variable y hasta vídeos procesados como secuencias de fotogramas. Esto lo hace extremadamente versátil para tareas de OCR avanzado, análisis de documentos PDF, comprensión de interfaces de usuario y reconocimiento de escritura a mano en múltiples idiomas.
Una de las funciones más potentes es su modo de pensamiento. Al activar tokens específicos en la instrucción del sistema, el modelo puede entrar en un estado de razonamiento interno donde piensa paso a paso antes de soltar la respuesta final. Este proceso de reflexión interna es vital para tareas de programación y lógica, permitiendo que la IA refine su estrategia antes de escribir el código final.
En el apartado de rendimiento, las cifras son sencillamente pasmosas. En una NVIDIA H100, puede alcanzar los 1.000 tokens por segundo, y en una RTX 5090 supera los 700. Esta velocidad es especialmente útil en tareas estructuradas como el código, donde el sistema de detención adaptable permite terminar el proceso más rápido si el modelo detecta que el resultado ya es estable, evitando pasos innecesarios.
Comparativa y posicionamiento en el mercado
Si ponemos a DiffusionGemma frente a su hermano mayor, Gemma 4 autorregresivo, vemos que hay un intercambio entre calidad y velocidad. En benchmarks como MMLU Pro o GPQA Diamond, el modelo de difusión puntúa más bajo. Sin embargo, la propuesta aquí no es ser la IA más inteligente del mundo, sino la más rápida y eficiente para el uso local y de baja simultaneidad.
Este movimiento de Google parece una respuesta indirecta al empuje de los modelos abiertos provenientes de China, como Qwen o DeepSeek. Al ofrecer un modelo con licencia Apache 2.0, Google se posiciona en el terreno del open source, permitiendo que cualquier desarrollador implemente la tecnología en sus propios proyectos sin restricciones excesivas, democratizando el acceso a una inferencia de bajísima latencia.
Para los desarrolladores, la integración es sencilla gracias al soporte de vLLM, que permite ejecutar el modelo mediante un servidor compatible con OpenAI. El uso de la arquitectura de bloques permite que la IA no se quede bloqueada en la secuencialidad, convirtiéndola en una herramienta brutal para aplicaciones interactivas en tiempo real donde cada milisegundo cuenta.
Esta innovadora herramienta de Google redefine la eficiencia en la ejecución local de IA, sustituyendo el flujo lento de palabra por palabra por una generación masiva y paralela de bloques de texto. Gracias a su arquitectura MoE y su capacidad multimodal, logra un equilibrio sorprendente entre un consumo de memoria contenido y una velocidad de procesamiento que deja atrás a los modelos tradicionales, consolidándose como la opción preferida para quienes buscan un asistente extremadamente rápido y flexible en su propia GPU.