Volver a Ideas
    Herramientas IA

    Gemma 4 en local: la guía completa para instalarlo y usarlo en tu Mac o PC

    9 de junio de 202614 min de lectura
    Pantalla de computadora con código de programación en fondo oscuro, representando desarrollo con modelos de IA local

    Hay un modelo de IA que Google lanzó este año, es de código abierto, corre en tu propia computadora y no te cuesta nada por consulta. Se llama Gemma 4. En su versión de 12 mil millones de parámetros —el 12B—, es hoy el punto dulce entre capacidad real y hardware que ya tienes en casa. Esta guía existe para que lo entiendas, lo instales y lo uses sin depender de nadie. Ya seas alguien que trabaja con agentes de IA o simplemente quieres probar un modelo local por primera vez.

    ¿Por qué tener un modelo de IA en tu propia computadora?

    La mayoría de las personas usa IA a través de una API o una app: ChatGPT, Claude, Gemini. Funciona bien. Pero hay tres problemas concretos que aparecen cuando dependes de esas plataformas:

    • Coste acumulado: si tienes agentes que hacen miles de consultas al día, el costo por token se convierte en una factura mensual real.
    • Privacidad: cada mensaje que envías sale de tu red. En muchos casos eso no importa. En otros (datos de clientes, contratos, información financiera), sí importa.
    • Dependencia: si la API cae, tu operación se para.

    Un modelo local elimina los tres. Una vez instalado, funciona sin internet, sin costos por consulta y sin que ningún tercero vea tus datos. El tradeoff es que necesitas hardware con RAM suficiente. Por eso importa elegir bien el modelo.

    ¿Qué es Gemma 4 y qué significan esos números?

    Gemma 4 es una familia de modelos de lenguaje lanzada por Google DeepMind en 2025. Son modelos de código abierto —lo que significa que puedes descargarlos, modificarlos y usarlos sin pagar licencia. El número que ves junto al nombre (4B, 12B, 27B) indica los parámetros del modelo: en términos simples, es una medida aproximada de su capacidad. Más parámetros generalmente significa respuestas más precisas, mejor razonamiento y más contexto que puede manejar.

    La versión 12B es la que más te interesa si tienes entre 16 y 64 GB de memoria en tu equipo. El 4B es más ligero pero limitado en tareas complejas. El 27B es más capaz pero requiere hardware más potente. Para el 95% de los casos —incluyendo agentes de IA, asistentes personales y análisis de documentos— el 12B da más que suficiente.

    Las variantes: ¿qué es una quantización y cuál te conviene?

    Cuando descargas Gemma 4 12B desde Ollama, el modelo ya viene en lo que se llama quantización de 4 bits (Q4). Esto merece una explicación rápida porque afecta directamente al espacio en disco y la RAM que necesitas.

    Un modelo de IA en su forma original almacena cada número con 16 bits de precisión (FP16). La quantización reduce esa precisión para que el modelo ocupe menos espacio —a cambio de una pequeña pérdida de calidad que en la práctica es imperceptible para uso normal. Las opciones más comunes:

    • Q4 (4 bits): el equilibrio estándar. Gemma 4 12B ocupa ~8.5 GB en disco. Calidad excelente para el 95% de los casos.
    • Q5 (5 bits): un poco más grande (~10.5 GB), marginal mejora de calidad. No justifica el coste de RAM extra salvo que lo notes en tu caso específico.
    • Q8 (8 bits): casi idéntico al modelo original en calidad, pero ocupa ~12 GB. Solo si tienes RAM de sobra y quieres máxima fidelidad.
    • FP16 (sin quantizar): el modelo completo, ~24 GB. Para investigadores o quien tenga 64+ GB de RAM disponible.

    Para instalación práctica en 2026, quédate con Q4. Es lo que Ollama usa por defecto cuando escribes ollama pull gemma4:12b y es lo que te recomiendo.

    La ventana de contexto: el concepto más importante que nadie explica bien

    Cuando alguien dice que un modelo 'tiene 256K de contexto', está hablando de cuánto puede leer y procesar en una sola conversación. Pero hay una diferencia importante entre lo que el modelo soporta en teoría y lo que realmente puedes usar en tu equipo.

    Gemma 4 12B soporta hasta 262.144 tokens de contexto nativo —eso es aproximadamente 200.000 palabras en una sola conversación. Impresionante. El problema es que para mantener ese contexto, el modelo necesita almacenar en memoria algo llamado KV cache (Key-Value cache): una estructura que guarda el estado de toda la conversación para que no tenga que procesarla desde cero en cada respuesta.

    Y ese KV cache cuesta RAM. Mucha RAM. Así se ve la relación entre contexto configurado y memoria real consumida:

    • 32.768 tokens (32K): ~7 GB de KV cache + 8.5 GB modelo = ~15 GB en total
    • 65.536 tokens (64K): ~14 GB de KV cache + 8.5 GB modelo = ~22 GB en total
    • 131.072 tokens (128K): ~27 GB de KV cache + 8.5 GB modelo = ~35 GB en total
    • 262.144 tokens (256K — máximo teórico): ~54 GB de KV cache + 8.5 GB modelo = ~62 GB. Imposible en equipos de 36 GB o menos.

    Esto explica por qué el contexto máximo del modelo no es el contexto que puedes usar en la práctica. Si tienes 36 GB de RAM, el techo real está en 64K tokens configurados —que son más que suficientes para conversaciones largas, análisis de documentos medianos y agentes con memoria activa.

    ¿En qué computadora cabe Gemma 4 12B?

    Aquí van los números reales, sin rodeos:

    • MacBook Air / Pro con 8 GB: NO funciona. El modelo solo ocupa 8.5 GB sin contexto. No queda nada para el sistema operativo.
    • MacBook 16 GB (M1/M2/M3): funciona en modo mínimo. Con contexto muy reducido (8K tokens) y sin otras apps abiertas. La experiencia es lenta y las respuestas tardan 3-5 minutos. No lo recomiendo para uso diario.
    • Mac con 32 GB: funciona bien. Puedes configurar hasta 32K tokens de contexto y tener otras apps abiertas. Velocidad aceptable (30-60 segundos por respuesta larga).
    • Mac Studio / Mac Pro 36 GB: el punto óptimo. Con 65K tokens de contexto, ~14 GB libres para el sistema y otras apps. Primera respuesta en frío: ~2 minutos. Segunda en adelante: 10-20 segundos.
    • Mac 64 GB o más: cómodo. Puedes ir hasta 128K tokens si lo necesitas.
    • PC con GPU NVIDIA RTX 4090 (24 GB VRAM): excelente. El modelo vive en la GPU y la velocidad es superior a Mac en generación de tokens. Limitación: el contexto está restringido por los 24 GB de VRAM.
    • PC con RTX 4080 (16 GB VRAM): funciona con Q4, contexto hasta 16K tokens. Más ajustado pero usable.

    Mac vs PC: ¿cuál es mejor para IA local?

    La ventaja principal de Apple Silicon es la memoria unificada (Unified Memory). En un Mac, la misma RAM física la comparten la CPU y la GPU —no hay separación. Esto significa que si tienes 36 GB, el modelo de IA puede usar todos los 36 GB. En un PC con GPU dedicada, la VRAM de la tarjeta gráfica está separada de la RAM del sistema. Si tienes un PC con 32 GB de RAM y una RTX 4080 de 16 GB VRAM, el modelo solo puede usar 16 GB (los de la GPU), aunque el sistema tenga más.

    En velocidad de generación de tokens (cuántas palabras por segundo produce el modelo), NVIDIA gana gracias a CUDA y su arquitectura de tensor cores. Pero en balance entre capacidad de contexto, privacidad, consumo eléctrico y facilidad de instalación, Apple Silicon es más conveniente para la mayoría de los casos de uso en 2026.

    Instalación paso a paso con Ollama

    Ollama es el estándar de facto para correr modelos locales en 2026. Abstrae toda la complejidad de compilar llama.cpp, gestionar drivers y configurar backends. Es lo que usarás.

    Paso 1: Instalar Ollama

    En Mac: descarga el instalador desde ollama.com. Es una app normal —arrastra al Applications, ábrela y aparece en la barra de menú. En Windows: descarga el instalador .exe desde la misma web. En Linux: ejecuta en terminal:

    curl -fsSL https://ollama.com/install.sh | sh

    Una vez instalado, Ollama corre como servicio en segundo plano en el puerto 11434. Puedes verificar que funciona abriendo una terminal y ejecutando:

    ollama --version

    Paso 2: Descargar Gemma 4 12B

    En tu terminal, escribe:

    ollama pull gemma4:12b

    El modelo pesa ~8.5 GB. Dependiendo de tu conexión, tardará entre 5 y 30 minutos. Ollama muestra una barra de progreso durante la descarga. Solo necesitas hacerlo una vez —el modelo queda guardado en tu disco.

    Paso 3: Primera conversación

    Para probarlo directamente en terminal:

    ollama run gemma4:12b

    Verás un prompt donde puedes escribir. La primera respuesta tarda más (el modelo se carga en RAM). Las siguientes son más rápidas porque el modelo permanece en memoria durante 10 minutos desde el último mensaje.

    Open WebUI: interfaz gráfica (opcional pero recomendado)

    Si prefieres una interfaz similar a ChatGPT en vez de la terminal, Open WebUI es la opción más popular. Necesitas Docker instalado. Luego ejecutas:

    docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main

    Abre tu navegador en http://localhost:3000 y tendrás una interfaz completa para chatear con Gemma 4. Puedes subir imágenes (el modelo las procesa), organizar conversaciones por carpetas y cambiar entre modelos si tienes varios descargados.

    Parámetros que cambian todo

    Si instalas Gemma 4 para uso básico en terminal, los valores por defecto funcionan. Pero si quieres configurarlo seriamente —especialmente para agentes—, hay tres parámetros que debes conocer:

    num_ctx: la ventana de contexto real

    Por defecto, Ollama usa 4.096 tokens de contexto (4K), aunque el modelo soporte 262K. Para aumentarlo, crea un Modelfile:

    FROM gemma4:12b\nPARAMETER num_ctx 65536

    Y aplícalo con: ollama create gemma4-64k -f Modelfile

    Con 65K tokens puedes tener conversaciones muy largas, analizar documentos extensos y usar system prompts detallados sin que el modelo 'olvide' el principio de la conversación.

    OLLAMA_KEEP_ALIVE: cuánto tiempo permanece en memoria

    Por defecto, Ollama descarga el modelo de RAM 5 minutos después del último mensaje. Si haces consultas frecuentes, puedes extenderlo para evitar el 'cold start' (el tiempo de carga inicial):

    OLLAMA_KEEP_ALIVE=30m ollama serve

    Ojo: mientras el modelo permanece en memoria, ocupa su RAM. En un equipo de 36 GB donde Gemma 4 12B con 64K contexto usa ~22 GB, extender demasiado el keep-alive deja poco margen para otras apps.

    OLLAMA_NUM_PARALLEL: solicitudes simultáneas

    Si varios agentes o usuarios consultan el modelo al mismo tiempo, puedes configurar cuántas solicitudes procesa en paralelo. El valor por defecto es 1. En un equipo de 36 GB con Gemma 4 cargado, quédate en 1 —agregar paralelismo multiplica el uso de KV cache y provoca OOM fácilmente.

    ¿Gemma 4 puede ver imágenes? ¿Leer links?

    Sí puede ver imágenes. Gemma 4 12B es un modelo multimodal: incluye un encoder de visión que procesa imágenes junto al texto. En Ollama, puedes pasar imágenes directamente en la API. En Open WebUI, hay un botón para adjuntarlas en la conversación. Cada imagen de tamaño estándar (960×1280 píxeles) consume aproximadamente 285 tokens de contexto.

    ¿Leer links o URLs? No directamente. El modelo no navega por internet —no puede abrir una URL y ver lo que hay. Para eso necesitas una herramienta externa (como el campo 'fetch-url' en frameworks de agentes) que descargue el contenido de la página y se lo pase al modelo como texto. El modelo entonces procesa ese texto. Es una distinción importante: la capacidad de 'leer' una web viene de la herramienta, no del modelo.

    Cómo usar Gemma 4 con agentes de IA

    Aquí es donde el modelo local deja de ser un juguete y se convierte en infraestructura real. Si usas agentes —sistemas autónomos que consultan el modelo muchas veces para completar tareas— el ahorro en costos de API puede ser enorme.

    Usando la API de Ollama directamente

    Ollama expone una API compatible con OpenAI en http://localhost:11434/v1. Cualquier framework que soporte OpenAI puede apuntar a esta URL en vez del servidor de OpenAI. Ejemplo en Python:

    from openai import OpenAI\nclient = OpenAI(base_url='http://localhost:11434/v1', api_key='not-needed')\nresponse = client.chat.completions.create(model='gemma4:12b', messages=[{'role': 'user', 'content': 'Hola'}])\nprint(response.choices[0].message.content)

    Configuración en OpenClaw (para usuarios avanzados)

    Si usas OpenClaw para orquestar agentes de IA, la configuración en models.json de cada agente tiene este formato:

    {"providers": {"ollama-local": {"baseUrl": "http://127.0.0.1:11434", "api": "ollama", "timeoutSeconds": 300, "models": [{"id": "gemma4:12b", "name": "Gemma 4 12B", "params": {"think": false, "num_ctx": 65536}}]}}}

    El parámetro crítico es num_ctx dentro de params. Sin él, Ollama usa el contexto por defecto (4K), que es insuficiente para agentes con system prompts largos. Cuando el system prompt de tu agente supera los tokens disponibles, el modelo devuelve respuestas de un solo carácter o simplemente falla. Ajustar num_ctx al valor correcto para tu hardware es el paso que más gente se salta —y el que más problemas causa.

    Un error común con agentes: system prompts que desbordan el contexto

    Los agentes con muchas herramientas configuradas generan system prompts grandes. Cada herramienta (memoria, calendario, búsqueda web, visión) añade su schema JSON al prompt del sistema. Un agente con 15 herramientas puede llegar fácilmente a 60.000 caracteres de system prompt —unos 20.000 tokens solo en configuración. Si tu num_ctx es 32K y el system prompt ya consume 20K tokens, solo te quedan 12K para la conversación real. Si además envías imágenes o documentos largos, te quedas sin espacio y el modelo falla. La solución es siempre aumentar num_ctx, no reducir las herramientas del agente.

    Mi punto de vista

    Te cuento cómo lo veo después de varios meses corriendo agentes locales con Gemma 4 12B en un Mac Studio M4 Max de 36 GB:

    El modelo local tiene sentido si tienes volumen. Si eres una persona que usa la IA esporádicamente para redactar o hacer preguntas, Claude o ChatGPT son más cómodos y probablemente más potentes para tu caso. Pero si tienes agentes que trabajan continuamente —revisando correos, respondiendo clientes, procesando documentos— el modelo local pasa de ser una curiosidad técnica a una pieza operativa real.

    Lo que más me ha sorprendido de Gemma 4 12B es la multimodalidad. Que un modelo que corre en local pueda ver imágenes y razonar sobre ellas abre posibilidades que hace un año solo estaban disponibles pagando por API. Para negocios que trabajan con documentos escaneados, fotos de productos o reportes visuales, esto es relevante.

    La limitación real no es la calidad del modelo —es el hardware. En un equipo de 16 GB la experiencia es frustrante. En 32 GB o más, funciona bien. Si estás evaluando actualizar tu equipo y usas IA regularmente, ese factor debería entrar en la ecuación. Un Mac con 36 GB que corre tus propios agentes locales tiene un coste fijo y predecible. Una factura de API con miles de consultas diarias, no.

    ¿Hacia dónde va esto? Los modelos locales seguirán mejorando y haciéndose más compactos. Gemma 4 12B de hoy equivale en muchos benchmarks a lo que era GPT-4 hace dos años. La siguiente generación probablemente hará lo mismo en la mitad de RAM. Si construyes tu infraestructura de agentes hoy en local, en 12-24 meses tendrás más capacidad con el mismo hardware.

    Preguntas frecuentes

    ¿Gemma 4 12B funciona en Windows?

    Sí. Ollama tiene instalador nativo para Windows. El modelo corre bien en equipos con GPU NVIDIA (con CUDA) o en CPU pura (más lento pero funcional). En AMD, el soporte via ROCm es experimental en 2026.

    ¿Cuánto tarda en responder comparado con ChatGPT?

    La primera respuesta en frío (cuando el modelo se carga desde disco) tarda entre 30 segundos y 2 minutos dependiendo del hardware. Las respuestas siguientes, con el modelo ya en memoria, son de 10-30 segundos para textos largos. ChatGPT responde en 2-5 segundos. El tradeoff es ese: velocidad vs privacidad y costo.

    ¿Se puede usar para código?

    Sí, aunque para tareas de programación existe Gemma 4 Code (variante especializada) y otros modelos como Qwen3-Coder. El 12B base maneja bien la mayoría del código estándar, pero si tu uso principal es programación, evalúa modelos especializados que suelen superar a los generalistas en esa tarea específica.

    ¿Consume mucha electricidad?

    En Mac M4 Max, el consumo durante inferencia activa ronda los 30-60W extra sobre el consumo base. Es marginal comparado con un PC con GPU dedicada (RTX 4090 consume 450W bajo carga). Si el modelo está en idle (cargado pero sin procesar), el consumo adicional es casi cero.

    ¿Necesito internet para usarlo?

    Solo para descargarlo la primera vez. Una vez instalado, Gemma 4 funciona completamente sin conexión. Esto es relevante si trabajas con datos sensibles o en entornos con conectividad limitada.

    ¿Quieres llevar estas ideas a la práctica?

    Podemos ayudarte a diseñar la estructura que tu negocio necesita.