Qué Mac necesitas para tus propios LLMs y agentes de IA — guía real
Cuando la gente me pregunta qué Mac comprar para meter IA en su negocio, casi siempre les paso una versión muy resumida de lo que vas a leer aquí. Pero como cada vez me lo preguntan más, decidí escribirlo bien. Hoy mismo, desde el Mac Studio M4 Max que llegó hace pocos días, te cuento qué hardware sirve, qué modelos correr, precios cloud actualizados, y cuándo vale la pena ir local y cuándo no.
Esto NO es marketing. Es lo que aprendí montando mi propio sistema, peleando con configuraciones que crashean, decidiendo entre modelos y midiendo qué corre estable y qué no. Si después de leer decides que tu caso es más simple del que yo necesito, mejor para ti — gastas menos.
La gran confusión que casi nadie te aclara
Hay dos caminos muy diferentes cuando te metes en IA local, y mezclarlos es la fuente de la mayoría de frustraciones.
Camino A — Solo LLM: tienes un modelo open source corriendo en tu Mac y le hablas como hablarías con ChatGPT. Sin agentes. Sin orquestación. Solo tú escribiendo prompts y leyendo respuestas. Es tu ChatGPT privado en casa.
Camino B — LLM con agentes: múltiples agentes orquestados que hacen tareas por ti — atender WhatsApp, gestionar agenda, redactar emails, publicar contenido, contestar leads. Cada agente tiene su rol, su memoria, sus herramientas, y todos comparten un cerebro LLM.
La diferencia operativa entre ambos es abismal. Casi todos los tutoriales hablan del Camino A. Casi nadie te avisa que el Camino B es otra liga: necesita más memoria, más cuidado, y cuando lo escalas a 3+ agentes en paralelo aparecen problemas que con un solo LLM nunca tienes.
Camino A: solo LLM en local
Si lo único que quieres es chatear con un modelo privado, sin pagar suscripción, esto se monta en una tarde. Bajas LM Studio o Ollama, descargas el modelo que quepa en tu Mac, y ya tienes tu ChatGPT privado funcionando. La calidad y velocidad dependen del tamaño del modelo y de la memoria de tu máquina.
Modelos que corren bien según tu Mac (Camino A)
- Mac M4 8-16 GB: Qwen3 4B, Llama 3.2 3B, Phi-3 mini. Buenos para chatear, traducir, resumir. NO para razonamiento complejo. Velocidad rápida.
- Mac M4 24 GB: Qwen3 14B, Gemma 2 9B. Asistente personal sólido para uso diario. Velocidad cómoda (~40-60 tokens/segundo).
- Mac M4 36 GB: Qwen3 30B-A3B (MoE), Mistral Small 22B. Calidad cercana a GPT-4o-mini. Velocidad ~70-80 tok/s en uso de un solo usuario.
- Mac M4 64 GB+: Qwen3 32B denso, Llama 3.3 70B Q4. Calidad cloud sin pagar API. Velocidad ~30-50 tok/s.
- Mac M3 Ultra 96+ GB: casi cualquier modelo open source actual.
Aviso importante sobre Qwen3 30B-A3B: es excelente como modelo único, pero bajo carga concurrente (varios chats a la vez o agentes simultáneos) se vuelve notoriamente lento y a veces inestable. Si solo lo vas a usar tú chateando, perfecto. Si planeas darle uso multi-agente, mejor leer la sección del Camino B.
Mi recomendación si estás en este camino: empieza con Qwen3 14B en una Mac de 24 GB. Es el sweet spot calidad/tamaño/velocidad/coste. Si después tu caso lo justifica, subes.
Cómo se chatea con un LLM local
Esta es una duda que no te suelen aclarar. Cuando pones un modelo open source en tu Mac, ¿cómo le hablas? Tienes varias opciones según tu nivel:
- Terminal puro (línea de comandos): usando
ollama run qwen3:14bo equivalente. Es la forma más cruda — escribes y respondes en blanco y negro. Sirve para probar pero no es agradable para uso diario. - LM Studio: aplicación oficial gratuita con interfaz gráfica. Descargas el modelo, abres el chat y ya. Lo más fácil para empezar. Sin curva de aprendizaje.
- Open WebUI: interfaz web open source tipo ChatGPT. Se conecta a tu Ollama local y te da una experiencia idéntica a la de OpenAI pero corriendo en tu máquina. Soporta múltiples conversaciones, búsqueda en historial, prompts guardados.
- App propia personalizada: con un poco de desarrollo (Next.js + cliente HTTP al modelo local) puedes hacerte tu propio ChatGPT con tu marca, tu memoria persistente y la lógica que tú quieras.
Sobre la última opción, hay algo que está pidiendo a gritos su propia guía: cómo construir una app tipo ChatGPT propia que guarde todas tus conversaciones, las indexe como memoria, y aprenda de ti con el tiempo. Eso da para un artículo entero — lo voy a escribir en las próximas semanas. Si te interesa, suscríbete al final y te lo mando cuando salga.
Camino B: LLM con agentes — donde se complica
Aquí es donde está mi sistema. Tres agentes orquestados — uno gestiona el negocio (WhatsApp, leads, agenda), otro hace contenido para redes, otro me ayuda con tareas personales.
La diferencia con el Camino A es que aquí necesitas más capas: orquestador, memoria persistente, integraciones a herramientas externas, y modelos que aguanten estar respondiendo en paralelo. La realidad operativa que aprendí:
- Un solo modelo grande para todos los agentes funciona, pero lento. Mi setup actual usa Qwen3 30B-A3B compartido entre 3 agentes — aguanta pero se nota la latencia bajo carga.
- Mejor opción real: uno o dos modelos medianos-pequeños (Qwen3 14B, Gemma 9B) sirviendo a los agentes. Más rápido, más estable, calidad suficiente para 80% de las tareas operativas.
- Fallback cloud obligatorio: cuando el modelo local crashea o la tarea requiere razonamiento profundo, los agentes deben seguir respondiendo. Sin fallback, tu sistema se cae.
El stack real que uso hoy
- Cerebro local primario: Qwen3 30B-A3B 4-bit (~16 GB en VRAM) — sirviendo a 3 agentes. Velocidad aceptable un solo usuario, lenta bajo concurrencia.
- Modelo de código: Qwen2.5-Coder 14B (~9 GB). Para tareas mecánicas: validar JSON, generar boilerplate, refactorizar.
- Fallback cloud primario: DeepSeek V4 Pro vía API directa. Calidad cercana a Claude Sonnet a una fracción del precio (más abajo te paso números).
- Orquestador: sistema propio para manejar agentes, skills, memoria e integraciones. La parte que no compartiré aquí en detalle — es nuestra propuesta de valor a clientes.
Precios reales del cloud (el comparativo que importa)
Si vas a tener fallback cloud, o si decides directamente saltarte el local y usar API, estos son los precios oficiales actuales (en USD por millón de tokens, verificados directo en las docs de cada proveedor):
Modelos cloud por precio (input/output por millón de tokens)
- DeepSeek V4 Pro (API directa): $0.435 input / $0.87 output con promoción 75% activa hasta 31 mayo 2026. Precio estándar después: $1.74 / $3.48. Calidad cercana a Claude Sonnet a una fracción del precio. Mi recomendación principal.
- DeepSeek V4 Flash (API directa): $0.14 input / $0.28 output. Más simple, ideal para tareas rápidas o volumen alto.
- Kimi K2 (Moonshot API directa): $0.60 input / $2.50 output. Excelente para tareas largas con mucho contexto.
- Kimi K2-turbo (Moonshot API directa): $1.15 input / $8.00 output. Más rápido pero el output sale notablemente más caro — calcula bien si compensa.
- Claude Haiku 4.5 (API directa): $1 / $5. Rápido y muy correcto para tareas operativas del día a día.
- Claude Sonnet 4.6 (API directa): $3 / $15. La opción premium para tareas complejas — el balance calidad/precio cuando hace falta razonamiento profundo.
- Claude Opus 4.7 (API directa): $5 / $25. La cima de Anthropic. Usar solo cuando la tarea lo justifique de verdad.
- OpenAI GPT-4o / 4o-mini: consulta precios actualizados en openai.com/api/pricing. Generalmente más caros que las alternativas equivalentes.
Ojo con OpenRouter y otros marketplaces: revenden los mismos modelos pero cobran un margen importante. Para Kimi K2 vi diferencias de hasta 5x. Lección: siempre API nativa del proveedor, no marketplaces.
Cuánto te puedes esperar gastar al mes: si tienes un solo agente con uso moderado (300-500 conversaciones/mes), DeepSeek V4 Pro te sale entre $3 y $8 mensuales. Para que te hagas la idea: ChatGPT Plus son 22 USD/mes — más caro y con menos control. Y un equipo de 3-5 personas usando intensivamente puede mantenerse bajo $30-50/mes con DeepSeek + Kimi como fallback inteligente.
Cómo funciona la memoria (sin entrar en cómo lo hago yo)
Aquí está el concepto que separa los juguetes de los sistemas reales. Un LLM por sí solo no tiene memoria entre conversaciones. Cada vez que abres ChatGPT, no se acuerda de la anterior — solo lee lo que está en la pantalla actual.
Para que tu IA recuerde tu negocio (clientes, decisiones, contexto, tono de marca, casos pasados), necesitas darle un sistema de memoria por fuera del modelo. Esto se llama context engineering.
Hay varias formas de hacerlo. En mi caso he construido una estructura propia que combina memoria operativa (lo que está pasando hoy en el negocio) con un sistema de notas y decisiones que la IA puede consultar antes de responder. Esa estructura es la que hace que mis agentes no parezcan loros sino colaboradores que conocen el negocio.
No voy a entrar aquí en el detalle de cómo está construida — esa es buena parte de la propuesta de valor que ofrecemos a clientes en el Centro de Mando. Pero lo que tienes que entender en este artículo es esto: sin memoria bien diseñada, tu IA es un loro caro. Con memoria bien diseñada, es un colaborador que aprende. Y la diferencia se nota desde el primer día.
Tu caso → tu setup recomendado
Esta es la tabla que más me piden. Mira tu necesidad real (no la que te imaginas dentro de dos años) y arranca por ahí. Después escalas si hace falta.
Caso 1: solo quiero chatear privado, ocasional
- Hardware: Mac Mini M4 16 GB (~700 €)
- Modelo: Qwen3 4B o Llama 3.2 3B
- Cómo chateas: LM Studio (app gráfica)
- Agentes: no
- Fallback cloud: no
- Tiempo de setup: una tarde
Caso 2: asistente personal o profesional diario
- Hardware: Mac Mini M4 Pro 24 GB (~1.300 €)
- Modelo: Qwen3 14B
- Cómo chateas: Open WebUI (web tipo ChatGPT) o LM Studio
- Agentes: no o uno muy simple
- Fallback cloud: opcional (DeepSeek)
- Tiempo de setup: uno o dos días
Caso 3: code helper para tu flujo de desarrollo
- Hardware: Mac M4 Pro 32 GB
- Modelo: Qwen2.5-Coder 14B o 30B
- Cómo chateas: integrado en tu editor (Cursor, Cline)
- Agentes: no
- Fallback cloud: opcional (Claude Code para casos complejos)
- Tiempo de setup: un día
Caso 4: un agente que opera mi negocio
- Hardware: Mac Mini M4 Pro 24 GB o Mac Studio M4 Max 36 GB
- Modelo: Qwen3 14B (rápido) o Qwen3 30B-A3B (más calidad pero lento)
- Agentes: sí, uno bien hecho
- Fallback cloud: sí (DeepSeek API)
- Tiempo de setup: una o dos semanas
Caso 5: tres o más agentes orquestados, alta concurrencia
- Hardware: Mac Studio M4 Max 36 GB+ o M3 Ultra 64+ GB
- Modelo: uno o dos modelos medianos (14B-22B) sirviendo a los agentes — más rápidos que un 30B único
- Agentes: sí, multi
- Fallback cloud: obligatorio (hoy en mi casa cubre el 95%)
- Tiempo de setup: uno o dos meses + ajuste continuo
Por qué vale la pena tener IA en local (cuando vale)
- Privacidad real: tus datos no salen de tu casa u oficina. Crítico si trabajas con datos sensibles (clientes, médicos, legales).
- Cero coste por uso: después de la inversión inicial, lo que consumes es luz. No te suben el precio cuando el modelo se hace popular.
- Independencia: el día que ChatGPT se cae globalmente (ya pasó), tu negocio sigue. El día que un proveedor cambie su política, tú ya tienes alternativa.
- Latencia mínima: respuesta instantánea sin pasar por internet. Crítico para asistentes de voz o flujos rápidos.
- Personalización profunda: puedes hacer fine-tuning, ajustar parámetros, modificar comportamientos. Lo que con cloud no haces.
Mi caso real — la verdad incómoda
Voy a ser honesto contigo porque odio los artículos donde el autor finge que todo le funciona perfecto. Yo soy exigente con mi setup: 3 agentes en paralelo, modelo de 30B, alta concurrencia. Y eso rompe cosas.
Hoy mismo, en mi casa, el 95% de las respuestas de mis agentes está saliendo por DeepSeek cloud, no por el modelo local. ¿Por qué? Porque MLX (la librería de Apple para correr modelos en Apple Silicon) crashea bajo carga concurrente, y el Qwen3 30B-A3B compartido entre 3 agentes se vuelve lento. Estoy resolviéndolo bajando a modelos medianos y ajustando configuración fina.
¿Significa que la Mac Studio fue un error? No necesariamente. Significa que el setup que YO necesito (3 agentes simultáneos en MLX) tiene deuda técnica que estoy resolviendo. Si tu caso es 1 agente con un modelo de 14B, te corre estable desde el primer día — me lo confirman varios clientes.
Por eso esta guía está organizada por casos. Tu setup no tiene que ser el mío. El mío es el de alguien que está empujando los límites. El tuyo puede ser mucho más simple y aun así darte privacidad, control y ahorro real.
Cuándo NO vale la pena ir local
Te lo digo claro porque no tiene sentido convencerte a la fuerza:
- Si solo usas IA una o dos horas a la semana: ChatGPT Plus a 22 €/mes te sale más barato que mantener tu propio setup.
- Si no quieres mantenimiento: el local requiere que alguien (tú o un técnico) actualice modelos, ajuste parámetros y monitoree errores. Si quieres olvidarte, paga cloud.
- Si necesitas siempre el último modelo de OpenAI o Anthropic: los modelos open source van un paso atrás del state-of-the-art cloud. La diferencia se cierra cada mes pero existe.
- Si tu equipo no es nada técnico: sin alguien que pueda diagnosticar cuando algo falla, vas a sufrir.
Resumen práctico
Si tuvieras que llevarte tres ideas de este artículo:
- Diferencia Camino A (solo LLM) de Camino B (LLM con agentes). No es lo mismo. La complejidad cambia 10x.
- Empieza por tu caso real, no por el más ambicioso. Mejor un setup pequeño que funciona que uno grande que crashea.
- El cloud como fallback no es trampa, es ingeniería buena. Modelo local primario + DeepSeek API de respaldo te da lo mejor de ambos mundos.
Si quieres conversar sobre tu caso
Si has llegado hasta aquí y crees que tu negocio podría tener sentido en el Camino B (agentes propios), conversemos. No vendo paquetes cerrados — cada Centro de Mando se monta a medida del negocio. Te diagnostico tu caso real y te digo qué setup tendría sentido (o si tu caso es más simple y te ahorras dinero).
Lo importante: no compres primero el hardware sin validar el caso de uso. Yo cometí ese error varias veces antes de aprender. Conversemos antes.
Próxima guía en camino: cómo construirte una app tipo ChatGPT propia, con frontend tuyo, conectada a tu modelo local y con memoria persistente. Si te suscribes al final del post te llega cuando salga.
¿Quieres llevar estas ideas a la práctica?
Podemos ayudarte a diseñar la estructura que tu negocio necesita.
Ideas relacionadas
Por qué tu IA actual te olvida cada mañana (y cómo construir una que aprenda de tu negocio)
Si cada vez que abres ChatGPT o tu chatbot tienes que volver a explicar quién eres y qué hace tu negocio, no estás usando IA — estás usando un buscador caro. Hay otra forma de hacerlo, y separa los juguetes de las herramientas reales.
Lo que nadie te dice antes de meter IA en tu negocio
La mayoría de negocios que prueban IA por primera vez terminan frustrados. No porque la tecnología sea mala, sino porque el proceso estuvo mal desde el inicio. Te cuento qué preguntar, en qué orden hacerlo y cuánto cuesta de verdad.
7 errores que cometes al armar tu chatbot de WhatsApp con IA (y por qué crees que la tecnología no funciona)
ManyChat, Tidio, Chatfuel... te prometen un chatbot listo en minutos. Lo que no te dicen es que sin límites de tokens, sin memoria, sin conexión a tu sistema y sin alguien que lo configure bien, vas a gastar plata y culpar a la tecnología. Te cuento los 7 errores que veo una y otra vez.