Pasé una tarde instalando IA local en mi Mac: las 5 verdades que los tutoriales no cuentan

Si tienes una Mac M-series de 16 a 36 GB de RAM y oíste por ahí que se puede "instalar inteligencia artificial local en cinco minutos" — para. Te ahorro horas, frustración y, posiblemente, miles de euros mal gastados en hardware.
Acabo de pasar una tarde completa probando esto. No fueron cinco minutos. Y lo que aprendí no aparece en ningún tutorial de YouTube ni en los blogs que repiten lo mismo unos a otros.
Te lo cuento sin maquillaje. Lo que sí funciona, lo que no, y cómo decidir si esto tiene sentido para tu negocio o si mejor te quedas con servicios en la nube por ahora.
Lo que sí puedes hacer con una Mac Studio de 36 GB
Aterrizar en la realidad primero. Una Mac de 36 GB no va a correr GPT-4 ni nada parecido. Eso vive en granjas de servidores que cuestan millones. Pero sí puede correr modelos de inteligencia artificial perfectamente útiles para una pyme o un profesional independiente.
Con el hardware adecuado y los modelos correctos, puedes tener funcionando dentro de tu Mac:
- Un asistente que te ayuda a redactar correos, propuestas y posts en redes
- Un lector que analiza contratos, informes o PDFs largos sin enviarlos a ningún servicio externo
- Un buscador inteligente sobre tus propios documentos y carpetas
- Una IA que responde preguntas frecuentes de clientes con contexto del negocio
- Un programador junior que te ayuda con scripts, automatizaciones y código
- Un tutor multilingüe para traducir, corregir o explicar en varios idiomas
Todo eso es real, alcanzable y sin pagar mensualidad a OpenAI o similar. Pero — y aquí viene lo importante — ninguno de esos casos es "darle órdenes a una IA superpoderosa". Son herramientas concretas, con límites concretos.
Los modelos de IA que caben en una Mac de 36 GB
Esto es un mapa rápido para que no te pierdas. Hay decenas de modelos. Estos son los que vale la pena considerar:
Llama 3.1 de 8 mil millones de parámetros (llama3.1:8b)
Pesa 4,7 GB. Ventana de contexto de 128.000 tokens. El "todoterreno de entrada". Si estás empezando, este es tu primer modelo. Funciona bien para chat general, redacción ligera y consultas rápidas. No es brillante pero no se rompe.
Mistral Nemo de 12 mil millones (mistral-nemo:12b)
Pesa 7 GB. Contexto real de 128.000 tokens. El "multilingüe". Maneja español, inglés, francés y varios más con calidad superior a Llama. Si tu negocio toca varios idiomas o lees documentos largos, este es el indicado.
Qwen 2.5 de 7 mil millones (qwen2.5:7b)
Pesa 4,7 GB. Contexto de 32.000 tokens. El "barato y bueno". Excelente relación calidad-recursos para tareas profesionales: redacción comercial, atención al cliente, análisis ligero.
Qwen 3 de 14 mil millones (qwen3:14b)
Pesa 9,3 GB. Aquí viene la primera trampa: el papel del modelo dice 128.000 tokens de contexto. Cuando lo descargas en tu Mac, la realidad es 40.000. Hablamos de esto más abajo. Es un razonador potente para análisis y contenido técnico, pero ojo con esa diferencia.
Granite 3.2 de 8 mil millones (granite3.2:8b)
Pesa 4,9 GB. Contexto real de 128.000 tokens. El "lector profesional" hecho por IBM, optimizado específicamente para leer contratos, informes y bases de documentos. Si trabajas con texto legal o material denso, este modelo está pensado para ti.
Qwen 2.5 Coder de 14 mil millones (qwen2.5-coder:14b)
Pesa 9 GB. Contexto de 32.000 tokens. El mejor programador open-source bajo los 20 mil millones de parámetros. Si vas a usar IA para escribir scripts, automatizar tareas o pedir ayuda con código, este gana.
GPT-OSS de 20 mil millones (gpt-oss:20b)
Pesa 13 GB. Contexto de 128.000 tokens. Es el modelo open-source recién liberado por OpenAI en 2025. Combina razonamiento alto, soporte de herramientas y nivel de detalle que se acerca a los modelos premium en la nube. Es el más serio que cabe en 36 GB de RAM.
DeepSeek R1 Distill de 14 mil millones (deepseek-r1-distill:14b)
Pesa 9 GB. Contexto de 128.000 tokens. El "filósofo". Razona en profundidad para problemas matemáticos, lógicos o decisiones complejas. Pero atención: no soporta llamadas a herramientas externas. Si quieres conectarlo a tu calendario, correo o base de datos, no te sirve. Es para pensar puro, no para operar.
Cuál elegir según tu caso de uso
Para que no pierdas tiempo probando todos, te lo simplifico:
- Eres empresario y quieres un asistente para correos y redacción comercial → instala mistral-nemo:12b
- Eres abogado, asesor o consultor que lee documentos largos → instala granite3.2:8b
- Eres desarrollador o haces tus propios scripts → instala qwen2.5-coder:14b
- Quieres una IA potente para razonar problemas complejos → instala gpt-oss:20b
- Estás empezando y solo quieres probar sin sustos → instala llama3.1:8b
- Manejas varios idiomas en tu día a día → instala mistral-nemo:12b
Nada te impide tener varios instalados a la vez. Cada uno pesa entre 5 y 13 GB. Si tienes espacio en disco, puedes alternar según la tarea.
Cómo instalar tu primera IA local — los comandos reales
Esta no es la guía completa paso a paso. Para eso ya escribí otra. Pero te dejo lo mínimo que necesitas saber para arrancar hoy mismo.
Abre tu Terminal y ejecuta esto:
- brew install ollama (instalas la base que orquesta los modelos)
- brew services start ollama (arrancas el servicio en segundo plano)
- curl http://localhost:11434/api/tags (verificas que funciona — debe responder algo)
- ollama pull mistral-nemo:12b (descargas tu primer modelo, tarda según tu conexión)
- ollama show mistral-nemo:12b (verificas la ventana de contexto real — este paso es clave)
- ollama run mistral-nemo:12b "Hola, ¿en qué puedes ayudarme?" (hablas con tu IA local)
Ese paso del "show" es el que ningún tutorial enseña, y es justamente donde la mayoría se equivoca. Hablemos de eso ahora.
Las 5 verdades que los tutoriales no te cuentan
Aquí está lo que aprendí en la práctica. Datos reales, no opiniones.
Verdad 1: La ventana de contexto del papel no es la que descargas
Cuando lees "Qwen 3 14B tiene 128.000 tokens de contexto" estás leyendo lo que el modelo soporta con configuración manual avanzada. Cuando ese mismo modelo se descarga por Ollama, viene configurado con 40.000 tokens por defecto. Diferencia de cuatro veces.
Esto importa porque la ventana de contexto es la cantidad de información que el modelo puede procesar de una sola vez. Si tu trabajo implica documentos largos o conversaciones extensas, una ventana de 40.000 se llena en pocas interacciones y el modelo empieza a "olvidar" el inicio.
La regla práctica: después de descargar cualquier modelo, ejecuta ollama show y mira la línea que dice context length. Esa es la verdad que vas a usar.
Verdad 2: No todos los modelos saben usar herramientas externas
Si solo quieres una IA que conversa contigo, casi cualquier modelo te sirve. Pero si quieres que esa IA llame a tu calendario, lea tu correo, busque en tu base de datos o ejecute funciones — necesitas que el modelo soporte lo que técnicamente se llama "function calling" o llamadas a herramientas.
Y aquí está la trampa: muchos modelos populares no lo soportan. Los modelos de "razonamiento puro" como DeepSeek R1 fueron entrenados para pensar profundamente, no para operar. Cuando intentas conectarlos a tus herramientas, simplemente no responden.
La regla: si vas a construir asistentes IA conectados a tus sistemas, verifica antes que el modelo soporte llamadas a funciones. Llama, Mistral Nemo, Qwen y GPT-OSS sí lo soportan. R1 distill no.
Verdad 3: Apple Silicon es bueno, pero tiene límites
La narrativa de marketing dice que las Mac M-series "corren modelos enormes sin sudar". La realidad es más mixta.
Una Mac Studio M4 Max puede cargar modelos de hasta 20 mil millones de parámetros sin problema. Pero cuando le metes ventanas de contexto grandes (60.000 tokens o más), las respuestas pueden tardar entre uno y tres minutos por turno. No es "lento". Es físicamente lo que tarda procesar tanta información en ese hardware.
Para conversación normal va volando. Para análisis de documentos extensos o conversaciones largas, prepárate a esperar.
Verdad 4: Si tu uso es intenso, los 36 GB se quedan cortos
Una Mac de 36 GB cubre con holgura el uso casual: un modelo cargado, conversación general, alguna consulta. Lo descubres rápido cuando intentas tener varias cosas funcionando a la vez.
Si quieres correr al mismo tiempo un modelo de IA + un sistema de visión (para analizar imágenes) + un sistema de audio (para transcribir voz) — empiezas a quedarte sin memoria. La Mac empieza a usar la memoria de intercambio del disco y todo se vuelve más lento.
Para uso casual personal: 36 GB suficiente. Para correr varios asistentes IA conectados a herramientas en producción real: 96 GB mínimo, 192 GB ideal.
Verdad 5: Para uso intermitente, la nube sigue siendo más barata
Este es el cálculo que casi nadie hace honestamente.
Comprar una Mac Studio M4 Ultra con 192 GB cuesta alrededor de 9.500 USD. Si la usas para tus IA propias, las amortizas en dos o tres años. Pero ojo: si tu uso es bajo o irregular, los servicios cloud salen mucho más baratos.
Un proveedor como DeepSeek cobra 0,14 USD por cada millón de tokens procesados. Para uso normal de un profesional o pyme pequeña, eso son entre 5 y 80 USD al mes. A ese ritmo, una Mac de 9.500 USD tarda más de diez años en amortizarse.
Comprar hardware tiene sentido cuando: tu volumen supera los diez millones de tokens al día, tu negocio requiere privacidad absoluta de los datos, o quieres independencia total de servicios externos. Para todo lo demás, los servicios cloud son la opción inteligente.
¿Comprar una Mac más grande o usar la nube?
Te lo dejo en una tabla mental:
- Uso esporádico o aprendizaje → API en la nube (5-30 USD al mes)
- Privacidad de datos crítica (clientes, legal, salud) → Mac local sí justifica el gasto
- Producción continua 24/7 con varios usuarios → Mac Studio de 192 GB o GPU dedicada en la nube
- Quieres empezar gratis hoy → instala llama3.1:8b en tu Mac actual
No hay respuesta única. Depende de tu volumen, tu sensibilidad de datos y tu paciencia operativa.
Mi punto de vista
Después de hacer esto en serio te digo lo que pienso. La IA local tiene sentido para casos concretos: privacidad absoluta, autonomía total, control técnico fino. Pero la mayoría de los empresarios que me preguntan por esto no necesitan instalarla en su Mac. Necesitan empezar a usar IA, punto.
Lo que yo veo en la realidad: los empresarios que mejor están aprovechando esta tecnología son los que conectaron asistentes IA a sus herramientas — calendario, correo, atención al cliente — sin meterse en complicaciones de hardware. Ahorran tiempo, atienden mejor a sus clientes y liberan a su equipo de lo mecánico para que se dedique a lo que de verdad mueve el negocio.
Si me preguntas para dónde va esto: hacia organigramas híbridos donde tus colaboradores digitales trabajan junto a tu equipo humano. No los reemplazan. Los apoyan. Y eso no necesita una Mac de diez mil dólares. Necesita la decisión de empezar.
En IA & Negocios llevamos meses construyendo exactamente eso para empresas reales en el mundo hispanohablante. No vendemos IA — instalamos sistemas operativos digitales con colaboradores que aprenden tu negocio. Si te interesa entender cómo se ve eso en tu caso concreto, te dejo el camino abajo.
Preguntas frecuentes sobre IA local en Mac
¿Qué Mac mínima necesito para correr una IA local?
Un Mac M-series con 16 GB de RAM ya puede correr modelos pequeños como Llama 3.1 de 8 mil millones de parámetros. Para algo más serio, recomiendo 36 GB de RAM mínimo. Para producción intensa con varios modelos, 96 GB o más.
¿Cuál es el mejor modelo de IA para instalar primero?
Si estás empezando, llama3.1:8b es la mejor opción. Pesa solo 4,7 GB, no exige hardware extremo y te permite entender cómo funciona el sistema sin frustración.
¿Puedo usar IA local sin saber programar?
Para conversar con la IA, sí — basta con instalar Ollama y escribir comandos básicos en la Terminal. Para conectarla a tus herramientas (calendario, correo, base de datos), vas a necesitar conocimiento técnico o contratar quien lo haga.
¿Es más barato comprar una Mac potente o pagar IA en la nube?
Depende del volumen. Para uso normal de una pyme, los servicios cloud cuestan entre 5 y 80 USD al mes. Comprar una Mac monstro de 9.500 USD solo tiene sentido si tu volumen es muy alto, necesitas privacidad absoluta o quieres independencia total.
¿La IA local funciona sin internet?
Sí — después de la descarga inicial del modelo, todo el procesamiento es local. Esa es una de sus mayores ventajas: tus datos nunca salen de tu Mac.
Por dónde empezar mañana
Si llegaste hasta aquí, ya tienes más claridad que el 95% de los empresarios que escuchan "IA local" y no saben por dónde meterle mano. Pero entre saber y hacer hay una distancia que se cruza con decisiones, no con más lectura.
Si tu interés es montar tu propia IA local: instala llama3.1:8b esta semana, juega con él, entiende sus límites. Esa primera tarde te va a enseñar más que diez artículos como este.
Si tu interés es que tu negocio empiece a operar con asistentes IA conectados a tus herramientas — sin meterte en complicaciones de hardware — entonces es momento de preguntarnos qué necesitarías tú concretamente. Cuéntame qué hace tu negocio y qué quieres que cambie en los próximos noventa días. Te respondo desde la experiencia, no desde el catálogo.
Escríbeme directamente por WhatsApp y te digo si esto tiene sentido para tu caso, o si mejor empiezas por la nube. Lo importante no es la herramienta, es el camino que te lleva a operar mejor.
¿Quieres llevar estas ideas a la práctica?
Podemos ayudarte a diseñar la estructura que tu negocio necesita.
Ideas relacionadas

Cómo montar tu propia IA local en una Mac (guía paso a paso, sin volverte loco)
Esta es la guía concreta que te lleva de cero a tener tu propia IA corriendo dentro de tu Mac. Los pasos exactos, los comandos exactos y las decisiones exactas. Si te interesó la idea de tener un asistente IA local que te ahorra tokens y aprende contigo, esto te enseña a montarlo.
Qué Mac necesitas para tus propios LLMs y agentes de IA — guía real
Te cuento qué Mac comprar, qué modelos correr, precios cloud reales y cómo se interactúa con un LLM local. Sin humo, con la verdad de mi setup actual.

El asistente de IA que vive dentro de tu Mac y aprende contigo (sin pagar a OpenAI)
Llevamos meses construyendo un copiloto IA que corre 100% local en una Mac. Aprende de cada interacción, no manda nada a la nube y nos ahorra dinero cada mes. Te cuento qué es, cómo lo construimos paso a paso, y para qué sirve si tienes un negocio o si solo eres una persona curiosa con una Mac decente.