Ejecutar un LLM local en un Mac mini
Sí, un Mac mini ejecuta bien LLM locales, pero la memoria decide cuáles. Un Mac mini de 16 GB admite modelos de hasta unos 8 mil millones de parámetros con margen. Los modelos de unos 30 mil millones necesitan 48 GB. Los de 70 mil millones necesitan 64 GB. Abajo tienes los tamaños reales de los archivos, los comandos de instalación de Ollama y MLX y cómo mantener activo un servidor de modelos.
Por qué el límite es la memoria
Apple silicon tiene memoria unificada. La CPU y la GPU comparten un mismo bloque. Eso es bueno para los LLM, porque la GPU puede usar casi toda la RAM. Pero macOS, tus apps, los pesos del modelo y la memoria de trabajo del modelo salen todos de ese mismo bloque.
La memoria de trabajo crece con la longitud del contexto. La documentación de Ollama dice que un contexto mayor necesita más memoria. Además, elige el contexto por defecto según la memoria de GPU disponible (docs.ollama.com/context-length, octubre de 2026).
- Menos de 24 GiB: 4k tokens.
- De 24 a 48 GiB: 32k tokens.
- 48 GiB o más: 256k tokens.
Así que un Mac de 16 GB empieza con el contexto más pequeño. LM Studio recomienda 16 GB o más en un Mac. Dice que las máquinas de 8 GB deberían limitarse a modelos más pequeños (requisitos del sistema de lmstudio.ai, octubre de 2026).
Nuestra regla práctica es más sencilla, y es nuestra, no de ningún fabricante. Deja el archivo del modelo al menos de 6 a 8 GB por debajo de la memoria del Mac. Así queda sitio para macOS, el contexto y un agente o un navegador. Deja más si además compilas en el mismo Mac.
Qué cabe, con tamaños reales
Estos son los tamaños de descarga de las versiones por defecto, que en estos modelos son de 4 bits. Vienen de las páginas de la biblioteca de Ollama en octubre de 2026.
- qwen3:8b ocupa 5,2 GB. llama3.1:8b ocupa 4,9 GB. Van holgados en 16 GB.
- gemma3:12b ocupa 8,1 GB. qwen3:14b ocupa 9,3 GB. En 16 GB caben justos, con poco sitio para nada más.
- gpt-oss:20b ocupa 14 GB. En un Mac de 16 GB deja casi nada para macOS. Considéralo fuera de alcance.
- gemma3:27b ocupa 17 GB, qwen3:30b ocupa 19 GB y qwen3.5:35b ocupa 24 GB. Estos piden 48 GB.
- llama3.1:70b ocupa 43 GB. Necesita 64 GB.
- gpt-oss:120b ocupa 65 GB. No cabe en ningún Mac mini, porque 64 GB es el máximo que admite un Mac mini.
Los modelos pequeños también se equivocan más. En nuestra prueba de abajo, un modelo de 600 millones de parámetros llamó al Mac mini "un ordenador portátil". Vale para una prueba rápida. No para trabajo real.
Instala Ollama
Ollama necesita macOS 14 Sonoma o posterior (docs.ollama.com/macos). Descarga la app desde la página de descargas o usa el script de instalación. En macOS, el script pone Ollama.app en Aplicaciones y enlaza el comando ollama en la carpeta bin local.
curl -fsSL https://ollama.com/install.sh | sh
Lo ejecutamos en máquinas macOS 26 alojadas en GitHub el 2 de octubre de 2026. Se instaló en unos 7 segundos. En dos de nuestras ejecuciones, el último paso falló con el mensaje Unable to find application named 'Ollama'. La app se instaló de todos modos. Abrirla por su ruta funcionó.
open /Applications/Ollama.app
Después descargamos un modelo diminuto y lo ejecutamos.
$ ollama --version ollama version is 0.35.0 $ ollama pull qwen3:0.6b $ ollama list NAME ID SIZE MODIFIED qwen3:0.6b 7df6b6e09427 522 MB Less than a second ago
Para uso real, descarga un modelo que quepa en tu memoria. Después comprueba que se ejecuta en la GPU. La columna Processor debería decir 100% GPU.
ollama pull qwen3:8b ollama run qwen3:8b ollama ps
O usa MLX o LM Studio
MLX es el framework de aprendizaje automático de la propia Apple. Su paquete para LLM se instala con pip. Lo instalamos en un entorno virtual y ejecutamos un modelo de mil millones de parámetros a 4 bits.
python3 -m venv ~/mlx && source ~/mlx/bin/activate pip install mlx-lm mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40
Imprimió la versión 0.32.0 de mlx-lm y un pico de memoria de 0,773 GB. Para modelos grandes, el README de MLX muestra un ajuste que aumenta la memoria que puede reservar la GPU. Necesita macOS 15 o posterior. Pon N por encima del tamaño del modelo en MB y por debajo de tu RAM total.
sudo sysctl iogpu.wired_limit_mb=N
LM Studio es una app de escritorio con un buscador de modelos. Su comando lms viene con la app. La documentación muestra lms server start para un servidor de API y lms daemon up para ejecutarlo sin la ventana. No probamos LM Studio para esta página.
Mantén en marcha el servidor de modelos
Por defecto, Ollama descarga un modelo de la memoria tras 5 minutos sin uso, según sus preguntas frecuentes. La siguiente petición espera entonces a que se vuelva a cargar. Para un servidor siempre encendido, mantén los modelos cargados. Las preguntas frecuentes dicen que definas las variables de la app de Mac con launchctl y luego reinicies la app.
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
Desactiva también el reposo, o el servidor se congela con el Mac.
sudo pmset -a sleep 0 sudo pmset -a disksleep 0 sudo pmset -a displaysleep 10
Notas de seguridad
Por defecto, Ollama escucha en 127.0.0.1, puerto 11434. Su API no pidió ninguna contraseña en nuestra prueba. Las preguntas frecuentes explican cómo escuchar en todas las redes con OLLAMA_HOST. No lo hagas en un Mac al que pueda llegar otra gente. Para usar el modelo desde tu portátil, reenvía el puerto por SSH.
ssh -N -L 11434:127.0.0.1:11434 user@your-mac
Después apunta tus herramientas a localhost, puerto 11434, en tu portátil. Hermes Agent y OpenClaw pueden usar un endpoint local así.
Qué Mac de MacRun encaja
Nuestro M6 en stock tiene 16 GB de memoria y un SSD de 256 GB. Ejecuta bien modelos de 8B junto a un agente. Es la máquina equivocada para modelos de 30B, y preferimos decirlo ya.
- M5 Pro con 48 GB y SSD de 1 TB: $299 al mes en el plan de agentes, más una tarifa de montaje de $199. Admite los modelos de 27B a 35B de arriba.
- M5 Pro con 64 GB y SSD de 1 TB: $349 al mes en el plan de agentes, más una tarifa de montaje de $249. Admite modelos de 70B a 4 bits.
Los dos son en preventa y están listos en una semana aproximadamente. Claude Code y Codex vienen instalados en el plan de agentes. Ollama, MLX o LM Studio los instalas tú con tu acceso de administrador.
Quién debería buscar en otro sitio. Si necesitas más de 64 GB, un Mac mini no puede dártelos. No ofrecemos Mac Studio ni servidores con GPU. Compara todos los modelos en la página de precios.
Preguntas frecuentes
¿Un Mac mini de 16 GB puede ejecutar un LLM local?
+
Sí. Los modelos de hasta unos 8 mil millones de parámetros caben con margen, como qwen3:8b con 5,2 GB. Los de 12 a 14 mil millones caben justos, con poca memoria libre para lo demás.
¿Cuánta memoria necesito para un modelo de 70B?
+
Un modelo de 70B a 4 bits, como llama3.1:70b, es una descarga de 43 GB en Ollama. Necesitas un Mac mini de 64 GB, más espacio para el contexto.
¿Qué es más rápido en un Mac mini, Ollama o MLX?
+
Los dos usan la GPU de Apple. MLX es el framework de la propia Apple, y Ollama es más fácil de ejecutar como servidor. Prueba los dos con el mismo modelo en tu propia máquina.
¿Cómo mantengo un modelo de Ollama siempre cargado?
+
Pon OLLAMA_KEEP_ALIVE a -1 con launchctl setenv y reinicia la app de Ollama. Por defecto, descarga un modelo tras 5 minutos sin uso.