Guide

Faire tourner un LLM local sur un Mac mini

Oui, un Mac mini fait bien tourner des LLM locaux, mais c’est la mémoire qui décide lesquels. Un Mac mini de 16 Go accueille des modèles jusqu’à environ 8 milliards de paramètres, avec de la marge. Les modèles d’environ 30 milliards demandent 48 Go. 70 milliards demandent 64 Go. Voici les tailles de fichier réelles, les commandes d’installation d’Ollama et de MLX, et comment garder un serveur de modèles actif.

Pourquoi la mémoire est la limite

Apple silicon a une mémoire unifiée. Le CPU et le GPU partagent une seule réserve. C’est un atout pour les LLM, car le GPU peut utiliser la plus grande partie de la RAM. Mais macOS, vos apps, les poids du modèle et sa mémoire de travail puisent tous dans cette même réserve.

La mémoire de travail grandit avec la longueur du contexte. La documentation d’Ollama indique qu’un contexte plus long demande plus de mémoire. Ollama choisit aussi le contexte par défaut selon la mémoire GPU disponible (docs.ollama.com/context-length, octobre 2026).

  • Moins de 24 GiB : 4k tokens.
  • De 24 à 48 GiB : 32k tokens.
  • 48 GiB ou plus : 256k tokens.

Un Mac de 16 Go démarre donc avec le plus petit contexte. LM Studio recommande 16 Go ou plus sur Mac. Il conseille aux machines de 8 Go de s’en tenir à de plus petits modèles (configuration requise sur lmstudio.ai, octobre 2026).

Notre règle empirique est plus simple, et c’est la nôtre, pas celle d’un éditeur. Gardez le fichier du modèle au moins 6 à 8 Go plus petit que la mémoire du Mac. Cela laisse de la place pour macOS, le contexte et un agent ou un navigateur. Laissez plus de marge si vous lancez aussi des builds sur le même Mac.

Ce qui tient, avec les tailles de fichier réelles

Ce sont les tailles de téléchargement des versions par défaut, en 4 bits pour ces modèles. Elles viennent des pages de la bibliothèque Ollama en octobre 2026.

  • qwen3:8b fait 5,2 Go. llama3.1:8b fait 4,9 Go. À l’aise sur 16 Go.
  • gemma3:12b fait 8,1 Go. qwen3:14b fait 9,3 Go. Sur 16 Go, c’est juste, avec peu de place pour autre chose.
  • gpt-oss:20b fait 14 Go. Sur un Mac de 16 Go, il ne reste presque rien pour macOS. Considérez-le comme hors de portée.
  • gemma3:27b fait 17 Go, qwen3:30b fait 19 Go et qwen3.5:35b fait 24 Go. Ceux-là veulent 48 Go.
  • llama3.1:70b fait 43 Go. Il lui faut 64 Go.
  • gpt-oss:120b fait 65 Go. Il ne tient sur aucun Mac mini, car 64 Go est le maximum qu’un Mac mini peut accueillir.

Les petits modèles font aussi plus d’erreurs. Dans notre test ci-dessous, un modèle de 0,6 milliard de paramètres a présenté le Mac mini comme "un ordinateur portable". Suffisant pour un test rapide. Pas pour du vrai travail.

Installer Ollama

Ollama demande macOS 14 Sonoma ou plus récent (docs.ollama.com/macos). Téléchargez l’app depuis la page de téléchargement, ou utilisez le script d’installation. Sur macOS, le script place Ollama.app dans Applications et crée un lien vers la commande ollama dans le dossier bin local.

curl -fsSL https://ollama.com/install.sh | sh

Nous l’avons lancé sur des machines macOS 26 hébergées par GitHub, le 2 octobre 2026. L’installation a pris environ 7 secondes. Dans deux de nos essais, la dernière étape a échoué avec le message Unable to find application named 'Ollama'. L’app était pourtant installée. L’ouvrir par son chemin a fonctionné.

open /Applications/Ollama.app

Nous avons ensuite téléchargé un tout petit modèle et l’avons lancé.

$ ollama --version
ollama version is 0.35.0
$ ollama pull qwen3:0.6b
$ ollama list
NAME          ID              SIZE      MODIFIED
qwen3:0.6b    7df6b6e09427    522 MB    Less than a second ago

Pour un vrai usage, téléchargez un modèle adapté à votre mémoire. Vérifiez ensuite qu’il tourne sur le GPU. La colonne Processor doit indiquer 100% GPU.

ollama pull qwen3:8b
ollama run qwen3:8b
ollama ps

Ou utiliser MLX ou LM Studio

MLX est le framework de machine learning d’Apple. Son paquet LLM s’installe avec pip. Nous l’avons installé dans un environnement virtuel et avons lancé un modèle de 1 milliard de paramètres en 4 bits.

python3 -m venv ~/mlx && source ~/mlx/bin/activate
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40

Il a affiché mlx-lm version 0.32.0 et un pic de mémoire de 0,773 Go. Pour les gros modèles, le README de MLX montre un réglage qui augmente la mémoire que le GPU peut réserver. Il demande macOS 15 ou plus récent. Gardez N au-dessus de la taille du modèle en Mo et en dessous de votre RAM totale.

sudo sysctl iogpu.wired_limit_mb=N

LM Studio est une app de bureau avec un navigateur de modèles. Sa commande lms est fournie avec l’app. La documentation montre lms server start pour un serveur d’API et lms daemon up pour tourner sans la fenêtre. Nous n’avons pas testé LM Studio pour cette page.

Garder le serveur de modèles actif

Par défaut, Ollama décharge un modèle après 5 minutes d’inactivité, selon sa FAQ. La requête suivante attend alors un rechargement. Pour un serveur toujours allumé, gardez les modèles chargés. La FAQ dit de définir les variables de l’app Mac avec launchctl, puis de redémarrer l’app.

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

Désactivez aussi la veille, sinon le serveur se fige avec le Mac.

sudo pmset -a sleep 0
sudo pmset -a disksleep 0
sudo pmset -a displaysleep 10

Notes de sécurité

Par défaut, Ollama écoute sur 127.0.0.1, port 11434. Son API n’a demandé aucun mot de passe dans notre test. La FAQ montre comment écouter sur tous les réseaux avec OLLAMA_HOST. Ne le faites pas sur un Mac que d’autres personnes peuvent joindre. Pour utiliser le modèle depuis votre portable, redirigez plutôt le port via SSH.

ssh -N -L 11434:127.0.0.1:11434 user@your-mac

Pointez ensuite vos outils vers localhost, port 11434, sur votre portable. Hermes Agent et OpenClaw peuvent tous deux utiliser un endpoint local de ce type.

Quel Mac MacRun convient

Notre M6 en stock a 16 Go de mémoire et un SSD de 256 Go. Il fait bien tourner les modèles 8B à côté d’un agent. Ce n’est pas la bonne machine pour les modèles 30B, et nous préférons le dire tout de suite.

  • M5 Pro avec 48 Go et un SSD de 1 To : $299 par mois avec l’offre Agent, plus des frais de préparation de $199. Accueille les modèles de 27B à 35B cités plus haut.
  • M5 Pro avec 64 Go et un SSD de 1 To : $349 par mois avec l’offre Agent, plus des frais de préparation de $249. Accueille les modèles 70B en 4 bits.

Les deux sont en précommande, prêts en une semaine environ. Claude Code et Codex sont installés avec l’offre Agent. Vous installez vous-même Ollama, MLX ou LM Studio, avec vos droits administrateur.

Qui devrait chercher ailleurs. Si vous avez besoin de plus de 64 Go, aucun Mac mini ne peut les accueillir. Nous ne proposons ni Mac Studio ni serveur GPU. Comparez tous les modèles sur la page des tarifs.

Questions fréquentes

Un Mac mini de 16 Go peut-il faire tourner un LLM local ?

+

Oui. Les modèles jusqu’à environ 8 milliards de paramètres tiennent avec de la marge, comme qwen3:8b avec 5,2 Go. Les modèles de 12 à 14 milliards tiennent tout juste, avec peu de mémoire pour le reste.

Combien de mémoire faut-il pour un modèle 70B ?

+

Un modèle 70B en 4 bits comme llama3.1:70b représente 43 Go à télécharger sur Ollama. Il vous faut un Mac mini de 64 Go, plus de la place pour le contexte.

Ollama ou MLX : lequel est le plus rapide sur un Mac mini ?

+

Les deux utilisent le GPU d’Apple. MLX est le framework d’Apple, et Ollama est plus simple à faire tourner comme serveur. Testez les deux avec le même modèle sur votre propre machine.

Comment garder un modèle Ollama chargé en permanence ?

+

Définissez OLLAMA_KEEP_ALIVE à -1 avec launchctl setenv et redémarrez l’app Ollama. Par défaut, elle décharge un modèle après 5 minutes d’inactivité.

Guides associés