La mayoría de los lanzamientos de modelos de IA te dan un modelo y una decisión: úsalo o no. Gemma 4 te da cinco modelos y hace una pregunta diferente: ¿qué hardware tienes?
Puede sonar a marketing, pero en realidad es lo más útil de esta familia. Cada miembro tiene una arquitectura diferente — no son simplemente copias escaladas de lo mismo. Los modelos edge usan Per-Layer Embeddings. El 12B eliminó por completo los encoders de visión y audio. El 26B enruta los tokens a través de una mezcla de 128 expertos. El 31B simplemente lanza sus 30,7 mil millones de parámetros contra cada token. Misma familia, filosofías de ingeniería diferentes, trade-offs diferentes.
Vamos a recorrerlos.
E2B — La IA de bolsillo (~1 GB de RAM)
El Gemma 4 más pequeño. Dos mil millones de parámetros, cuantizado para caber en aproximadamente 1 GB de RAM. Maneja texto, imágenes y audio en vivo — todo en el dispositivo, todo sin conexión. Obtiene 37,5 % en AIME 2026, que es razonamiento de matemáticas competitivas en algo que podría correr en una Raspberry Pi. La salsa secreta es Per-Layer Embeddings (PLE), que da a cada capa del decoder su propio embedding dedicado para maximizar la inteligencia sin inflar la cantidad de parámetros. No lo confundirás con un modelo de escritorio, pero para traducciones rápidas, preguntas sobre fotos o consultas por voz en un teléfono económico, es genuinamente útil.
E4B — La potencia de bolsillo (4–6 GB de RAM)
El E4B es lo que pasa cuando le das a un modelo optimizado para teléfono suficientes parámetros para realmente pensar. Obtiene 42,5 % en AIME 2026 — más del doble que el modelo 27B mucho más grande de Gemma 3. Maneja texto, imágenes y audio de forma nativa, tiene una ventana de contexto de 128K e incluye un modo de razonamiento configurable para razonamiento multi-paso. Si tienes un teléfono insignia moderno con 8+ GB de RAM, este es el modelo que convierte “le pregunto a mi teléfono — sin conexión” en una opción seria en vez de un truco de fiesta.
12B Unified — El motor de agentes privados para portátiles (~7 GB VRAM con QAT)
Aquí es donde Gemma 4 se pone emocionante para la mayoría. Lanzado el 3 de junio de 2026, el 12B Unified hace algo que ningún otro modelo de su tamaño hace: maneja texto, imágenes y audio en un solo transformer decoder-only sin encoders separados. Los parches de imagen crudos y las ondas de audio van directo al espacio de embeddings a través de capas lineales ligeras. Arquitectura más simple, menor latencia, fine-tuning más fácil.
Los números: 77,2 % en MMLU Pro, 77,5 % en AIME 2026, 72,0 % en LiveCodeBench, 78,8 % en GPQA Diamond. Google dice que se acerca al 26B MoE “con menos de la mitad del footprint total de memoria.” Con la variante oficial QAT (Quantization-Aware Training) lanzada el 5 de junio, la versión Q4_0 necesita aproximadamente 6,7 GB de VRAM. Combina eso con Multi-Token Prediction para decodificación especulativa, y los benchmarks de la comunidad muestran 100–130+ tokens por segundo en una GPU de 12 GB como la RTX 4070 Super. Incluso corre en laptops con 16 GB de memoria unificada — sin necesidad de GPU dedicada.
Si quieres ejecutar agentes de IA autónomos, asistentes de voz locales o flujos de programación privados directamente en tu portátil sin depender de la nube ni asumir riesgos de privacidad, este es tu modelo.
26B MoE — El experto en eficiencia (15–18 GB de VRAM cuantizado)
El 26B contiene 26 mil millones de parámetros en total, pero aquí está el truco: solo 3,8 mil millones se activan por token. Un router aprendido selecciona 2 de 128 sub-redes de expertos para cada token, entregando calidad cercana al 31B con un costo de cómputo dramáticamente menor. Piénsalo como tener un edificio lleno de especialistas y solo llamar a los dos que necesitas para cada pregunta.
Soporta texto, imágenes y video (no solo audio como los modelos más pequeños), tiene una ventana de contexto de 256K y se ubica en el #6 entre modelos abiertos en Arena AI. El trade-off es la VRAM — necesitas 15–18 GB cuantizado, lo que significa una RTX 4090, una RTX 5060 Ti de 16GB, o una Mac con 32 GB+ de memoria unificada. Si tienes el hardware y quieres la mejor relación inteligencia-por-watt, este es tu modelo.
31B Dense — El gigante sin compromisos (16–20 GB de VRAM cuantizado)
Sin routing, sin mezcla de expertos, sin atajos. El 31B Dense activa todos sus 30,7 mil millones de parámetros en cada token. Es el techo de calidad de la familia Gemma 4 — ubicándose en el #3 entre todos los modelos abiertos en Arena AI y obteniendo 89,2 % en AIME 2026. Las mismas modalidades que el 26B (texto, imágenes, video), la misma ventana de contexto de 256K, pero con la máxima profundidad de razonamiento en cada respuesta.
El costo es cómputo. BF16 necesita ~71 GB de VRAM (territorio de GPUs empresariales). Pero cuantizado a INT4, cabe en 16–20 GB — manejable en una GPU de consumo de gama alta. Si tienes el hardware y la precisión importa más que la velocidad, este es el modelo abierto que más se acerca al rendimiento cloud de frontera.
¿Cuál deberías elegir?
Aquí va la guía rápida y honesta:
- Teléfono, sin conexión, tareas rápidas → E4B (o E2B para dispositivos muy limitados)
- Laptop, GPU de 8–12 GB → 12B Unified con QAT
- Laptop, 16 GB de memoria unificada, sin GPU → 12B Unified con QAT (más lento pero funciona)
- Estación de trabajo, RTX 4090 / Mac de 32 GB → 26B MoE (mejor calidad por watt)
- Servidor o estación de trabajo de gama alta → 31B Dense (calidad máxima)
Los cinco comparten la licencia Apache 2.0, soportan 140+ idiomas y funcionan con Ollama, llama.cpp, LM Studio, vLLM y el toolkit AI Edge de Google. La familia no se pone de acuerdo en la arquitectura — pero sí en la filosofía: IA seria que corre en tu hardware.