Guida

Far girare un LLM locale su un Mac mini

Sì, un Mac mini fa girare bene gli LLM locali, ma è la memoria a decidere quali. Un Mac mini da 16 GB regge modelli fino a circa 8 miliardi di parametri, con margine. I modelli intorno ai 30 miliardi richiedono 48 GB. Per 70 miliardi servono 64 GB. Qui sotto trovi le dimensioni reali dei file, i comandi di installazione per Ollama e MLX e come tenere attivo un server di modelli.

Perché il limite è la memoria

Apple silicon ha la memoria unificata. CPU e GPU condividono un unico pool. Per gli LLM è un vantaggio, perché la GPU può usare quasi tutta la RAM. Ma macOS, le tue app, i pesi del modello e la memoria di lavoro del modello arrivano tutti da quello stesso pool.

La memoria di lavoro cresce con la lunghezza del contesto. La documentazione di Ollama dice che un contesto più grande richiede più memoria. Ollama sceglie anche il contesto predefinito in base alla memoria GPU disponibile (docs.ollama.com/context-length, ottobre 2026).

  • Sotto 24 GiB: 4k token.
  • Da 24 a 48 GiB: 32k token.
  • 48 GiB o più: 256k token.

Quindi un Mac da 16 GB parte con il contesto più piccolo. LM Studio consiglia 16 GB o più su un Mac. Dice che le macchine da 8 GB dovrebbero restare sui modelli più piccoli (requisiti di sistema su lmstudio.ai, ottobre 2026).

La nostra regola pratica è più semplice, ed è nostra, non di un produttore. Tieni il file del modello almeno da 6 a 8 GB più piccolo della memoria del Mac. Così resta spazio per macOS, il contesto e un agente o un browser. Lascia più margine se sullo stesso Mac fai anche build.

Cosa ci sta, con le dimensioni reali dei file

Queste sono le dimensioni di download delle build predefinite, che per questi modelli sono a 4 bit. Vengono dalle pagine della libreria di Ollama, a ottobre 2026.

  • qwen3:8b pesa 5,2 GB. llama3.1:8b pesa 4,9 GB. Comodi su 16 GB.
  • gemma3:12b pesa 8,1 GB. qwen3:14b pesa 9,3 GB. Su 16 GB ci stanno a fatica, con poco spazio per altro.
  • gpt-oss:20b pesa 14 GB. Su un Mac da 16 GB lascia quasi nulla a macOS. Consideralo fuori portata.
  • gemma3:27b pesa 17 GB, qwen3:30b 19 GB e qwen3.5:35b 24 GB. Questi vogliono 48 GB.
  • llama3.1:70b pesa 43 GB. Servono 64 GB.
  • gpt-oss:120b pesa 65 GB. Non sta in nessun Mac mini, perché 64 GB è il massimo che un Mac mini può avere.

I modelli piccoli fanno anche più errori. Nel nostro test qui sotto, un modello da 0,6 miliardi di parametri ha definito il Mac mini "un computer portatile". Va bene per una prova veloce. Non per il lavoro vero.

Installa Ollama

Ollama richiede macOS 14 Sonoma o successivo (docs.ollama.com/macos). Scarica l’app dalla pagina di download, oppure usa lo script di installazione. Su macOS lo script mette Ollama.app in Applicazioni e collega il comando ollama nella cartella local bin.

curl -fsSL https://ollama.com/install.sh | sh

L’abbiamo eseguito su macchine macOS 26 in hosting su GitHub, il 2 ottobre 2026. Si è installato in circa 7 secondi. In due delle nostre esecuzioni l’ultimo passaggio è fallito con il messaggio Unable to find application named 'Ollama'. L’app era comunque installata. Aprirla tramite il suo percorso ha funzionato.

open /Applications/Ollama.app

Poi abbiamo scaricato un modello minuscolo e l’abbiamo eseguito.

$ ollama --version
ollama version is 0.35.0
$ ollama pull qwen3:0.6b
$ ollama list
NAME          ID              SIZE      MODIFIED
qwen3:0.6b    7df6b6e09427    522 MB    Less than a second ago

Per l’uso reale, scarica un modello che sta nella tua memoria. Poi verifica che giri sulla GPU. La colonna Processor deve indicare 100% GPU.

ollama pull qwen3:8b
ollama run qwen3:8b
ollama ps

Oppure usa MLX o LM Studio

MLX è il framework di machine learning di Apple. Il suo pacchetto per gli LLM si installa con pip. L’abbiamo installato in un ambiente virtuale e abbiamo eseguito un modello da 1 miliardo di parametri a 4 bit.

python3 -m venv ~/mlx && source ~/mlx/bin/activate
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40

Ha stampato la versione 0.32.0 di mlx-lm e un picco di memoria di 0,773 GB. Per i modelli grandi, il README di MLX mostra un’impostazione che aumenta la memoria che la GPU può trattenere. Richiede macOS 15 o successivo. Tieni N sopra la dimensione del modello in MB e sotto la tua RAM totale.

sudo sysctl iogpu.wired_limit_mb=N

LM Studio è un’app desktop con un browser di modelli. Il suo comando lms è incluso nell’app. La documentazione mostra lms server start per un server API e lms daemon up per girare senza la finestra. Per questa pagina non abbiamo testato LM Studio.

Tieni attivo il server di modelli

Secondo le sue FAQ, di default Ollama scarica un modello dalla memoria dopo 5 minuti di inattività. La richiesta successiva deve poi aspettare che venga ricaricato. Per un server sempre acceso, tieni i modelli caricati. Le FAQ dicono di impostare le variabili per l’app Mac con launchctl, poi riavviare l’app.

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

Disattiva anche lo stop, altrimenti il server si congela insieme al Mac.

sudo pmset -a sleep 0
sudo pmset -a disksleep 0
sudo pmset -a displaysleep 10

Note di sicurezza

Di default Ollama ascolta su 127.0.0.1, porta 11434. Nel nostro test la sua API non ha chiesto nessuna password. Le FAQ mostrano come ascoltare su tutte le reti con OLLAMA_HOST. Non farlo su un Mac che altre persone possono raggiungere. Per usare il modello dal tuo portatile, inoltra invece la porta via SSH.

ssh -N -L 11434:127.0.0.1:11434 user@your-mac

Poi punta i tuoi strumenti su localhost, porta 11434, sul tuo portatile. Hermes Agent e OpenClaw possono entrambi usare un endpoint locale come questo.

Quale Mac di MacRun fa al caso tuo

Il nostro M6 disponibile a magazzino ha 16 GB di memoria e un SSD da 256 GB. Fa girare bene i modelli 8B accanto a un agente. È la macchina sbagliata per i modelli 30B, e preferiamo dirtelo subito.

  • M5 Pro con 48 GB e SSD da 1 TB: $299 al mese con il piano Agent, più un costo di preparazione di $199. Regge i modelli da 27B a 35B qui sopra.
  • M5 Pro con 64 GB e SSD da 1 TB: $349 al mese con il piano Agent, più un costo di preparazione di $249. Regge i modelli 70B a 4 bit.

Sono entrambi in preordine, pronti in circa una settimana. Con il piano Agent, Claude Code e Codex arrivano installati. Ollama, MLX o LM Studio li installi tu, con i diritti di amministratore.

Chi dovrebbe cercare altrove. Se ti servono più di 64 GB, un Mac mini non li può avere. Non offriamo Mac Studio né server con GPU. Confronta tutti i tagli nella pagina dei prezzi.

Domande frequenti

Un Mac mini da 16 GB può far girare un LLM locale?

+

Sì. I modelli fino a circa 8 miliardi di parametri ci stanno con margine, come qwen3:8b da 5,2 GB. I modelli da 12 a 14 miliardi ci stanno a fatica, con poca memoria libera per altro.

Quanta memoria mi serve per un modello 70B?

+

Un modello 70B a 4 bit come llama3.1:70b è un download da 43 GB su Ollama. Ti serve un Mac mini da 64 GB, più spazio per il contesto.

Su un Mac mini è più veloce Ollama o MLX?

+

Entrambi usano la GPU Apple. MLX è il framework di Apple, mentre Ollama è più semplice da far girare come server. Provali entrambi con lo stesso modello sulla tua macchina.

Come tengo un modello di Ollama sempre caricato?

+

Imposta OLLAMA_KEEP_ALIVE a -1 con launchctl setenv e riavvia l’app Ollama. Di default scarica un modello dalla memoria dopo 5 minuti di inattività.

Guide correlate