Ein lokales LLM auf einem Mac mini betreiben
Ja, ein Mac mini führt lokale LLMs gut aus, aber der Arbeitsspeicher entscheidet, welche. Auf einen Mac mini mit 16 GB passen Modelle bis etwa 8 Milliarden Parameter mit Luft. Modelle um 30 Milliarden brauchen 48 GB. 70 Milliarden brauchen 64 GB. Unten finden Sie die echten Dateigrößen, die Installationsbefehle für Ollama und MLX und wie Sie einen Modellserver am Laufen halten.
Warum der Arbeitsspeicher die Grenze ist
Apple Silicon hat gemeinsamen Arbeitsspeicher. CPU und GPU teilen sich einen Pool. Das ist gut für LLMs, denn die GPU kann den Großteil des RAM nutzen. Aber macOS, Ihre Apps, die Modellgewichte und der Arbeitsspeicher des Modells kommen alle aus demselben Pool.
Der Arbeitsspeicher des Modells wächst mit der Kontextlänge. Laut Doku von Ollama braucht ein größerer Kontext mehr Speicher. Ollama wählt den Standardkontext auch nach dem verfügbaren GPU-Speicher (docs.ollama.com/context-length, Oktober 2026).
- Unter 24 GiB: 4k Tokens.
- Von 24 bis 48 GiB: 32k Tokens.
- 48 GiB oder mehr: 256k Tokens.
Ein Mac mit 16 GB startet also mit dem kleinsten Kontext. LM Studio empfiehlt auf einem Mac 16 GB oder mehr. Maschinen mit 8 GB sollen laut LM Studio bei kleineren Modellen bleiben (Systemanforderungen auf lmstudio.ai, Oktober 2026).
Unsere Faustregel ist einfacher, und sie stammt von uns, nicht von einem Hersteller. Die Modelldatei sollte mindestens 6 bis 8 GB kleiner sein als der Arbeitsspeicher des Mac. Das lässt Platz für macOS, den Kontext und einen Agent oder einen Browser. Lassen Sie mehr Luft, wenn auf demselben Mac auch Builds laufen.
Was passt, mit echten Dateigrößen
Das sind die Downloadgrößen der Standard-Builds, bei diesen Modellen 4-Bit. Sie stammen von den Seiten der Ollama-Bibliothek im Oktober 2026.
- qwen3:8b hat 5,2 GB. llama3.1:8b hat 4,9 GB. Bequem auf 16 GB.
- gemma3:12b hat 8,1 GB. qwen3:14b hat 9,3 GB. Auf 16 GB wird es eng, mit wenig Platz für anderes.
- gpt-oss:20b hat 14 GB. Auf einem Mac mit 16 GB bleibt damit fast nichts für macOS. Betrachten Sie es als außer Reichweite.
- gemma3:27b hat 17 GB, qwen3:30b hat 19 GB und qwen3.5:35b hat 24 GB. Diese wollen 48 GB.
- llama3.1:70b hat 43 GB. Das braucht 64 GB.
- gpt-oss:120b hat 65 GB. Es passt auf keinen Mac mini, denn 64 GB sind das Maximum, das ein Mac mini haben kann.
Kleine Modelle machen auch mehr Fehler. In unserem Test unten nannte ein Modell mit 0,6 Milliarden Parametern den Mac mini "a portable computer." Gut für einen Smoke-Test. Nicht für echte Arbeit.
Ollama installieren
Ollama braucht macOS 14 Sonoma oder neuer (docs.ollama.com/macos). Holen Sie die App von der Downloadseite oder nutzen Sie das Installationsskript. Unter macOS legt das Skript Ollama.app in Programme ab und verlinkt den Befehl ollama in den lokalen bin-Ordner.
curl -fsSL https://ollama.com/install.sh | sh
Wir haben es am 2. Oktober 2026 auf von GitHub gehosteten Maschinen mit macOS 26 ausgeführt. Die Installation dauerte etwa 7 Sekunden. In zwei unserer Läufe schlug der letzte Schritt mit der Meldung Unable to find application named 'Ollama' fehl. Die App war trotzdem installiert. Über ihren Pfad ließ sie sich öffnen.
open /Applications/Ollama.app
Dann haben wir ein winziges Modell geladen und ausgeführt.
$ ollama --version ollama version is 0.35.0 $ ollama pull qwen3:0.6b $ ollama list NAME ID SIZE MODIFIED qwen3:0.6b 7df6b6e09427 522 MB Less than a second ago
Für echte Nutzung laden Sie ein Modell, das zu Ihrem Arbeitsspeicher passt. Prüfen Sie dann, ob es auf der GPU läuft. In der Spalte Processor sollte 100% GPU stehen.
ollama pull qwen3:8b ollama run qwen3:8b ollama ps
Oder MLX oder LM Studio nutzen
MLX ist Apples eigenes Framework für maschinelles Lernen. Sein LLM-Paket installieren Sie mit pip. Wir haben es in einer virtuellen Umgebung installiert und ein 4-Bit-Modell mit 1 Milliarde Parametern ausgeführt.
python3 -m venv ~/mlx && source ~/mlx/bin/activate pip install mlx-lm mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40
Es gab mlx-lm Version 0.32.0 und einen Spitzenverbrauch von 0,773 GB Arbeitsspeicher aus. Für große Modelle zeigt das README von MLX eine Einstellung, die den Speicher erhöht, den die GPU halten darf. Sie braucht macOS 15 oder neuer. Halten Sie N über der Modellgröße in MB und unter Ihrem gesamten RAM.
sudo sysctl iogpu.wired_limit_mb=N
LM Studio ist eine Desktop-App mit einem Modellbrowser. Der Befehl lms kommt mit der App. Die Doku zeigt lms server start für einen API-Server und lms daemon up für den Betrieb ohne Fenster. LM Studio haben wir für diese Seite nicht getestet.
Den Modellserver am Laufen halten
Standardmäßig entlädt Ollama ein Modell nach 5 Minuten Leerlauf, laut FAQ. Die nächste Anfrage wartet dann, bis es neu geladen ist. Für einen dauerhaft laufenden Server halten Sie Modelle geladen. Laut FAQ setzen Sie Variablen für die Mac-App mit launchctl und starten die App dann neu.
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
Schalten Sie auch den Ruhezustand ab, sonst friert der Server mit dem Mac ein.
sudo pmset -a sleep 0 sudo pmset -a disksleep 0 sudo pmset -a displaysleep 10
Hinweise zur Sicherheit
Ollama lauscht standardmäßig auf 127.0.0.1, Port 11434. Seine API hat in unserem Test nach keinem Passwort gefragt. Die FAQ zeigt, wie es mit OLLAMA_HOST auf allen Netzwerken lauscht. Tun Sie das nicht auf einem Mac, den andere erreichen können. Um das Modell von Ihrem Laptop aus zu nutzen, leiten Sie den Port stattdessen per SSH weiter.
ssh -N -L 11434:127.0.0.1:11434 user@your-mac
Dann richten Sie Ihre Tools auf localhost, Port 11434, auf Ihrem Laptop. Hermes Agent und OpenClaw können beide einen solchen lokalen Endpunkt nutzen.
Welcher Mac von MacRun passt
Unser M6 auf Lager hat 16 GB Arbeitsspeicher und eine 256 GB SSD. Er führt 8B-Modelle neben einem Agent gut aus. Für 30B-Modelle ist er die falsche Maschine, und das sagen wir lieber gleich.
- M5 Pro mit 48 GB und 1 TB SSD: $299 pro Monat im Agent-Tarif, zuzüglich $199 Einrichtungsgebühr. Passt für die Modelle mit 27B bis 35B von oben.
- M5 Pro mit 64 GB und 1 TB SSD: $349 pro Monat im Agent-Tarif, zuzüglich $249 Einrichtungsgebühr. Passt für 70B-Modelle in 4-Bit.
Beide sind Vorbestellungen und in etwa einer Woche bereit. Im Agent-Tarif sind Claude Code und Codex installiert. Ollama, MLX oder LM Studio installieren Sie selbst mit Admin-Rechten.
Wer woanders suchen sollte. Wenn Sie mehr als 64 GB brauchen, kann ein Mac mini das nicht leisten. Mac Studio oder GPU-Server bieten wir nicht an. Vergleichen Sie alle Stufen auf der Preisseite.
Häufige Fragen
Kann ein Mac mini mit 16 GB ein lokales LLM ausführen?
+
Ja. Modelle bis etwa 8 Milliarden Parameter passen mit Luft, etwa qwen3:8b mit 5,2 GB. Modelle mit 12 bis 14 Milliarden passen knapp und lassen wenig Speicher für anderes.
Wie viel Arbeitsspeicher brauche ich für ein 70B-Modell?
+
Ein 70B-Modell in 4-Bit wie llama3.1:70b ist bei Ollama ein Download von 43 GB. Dafür brauchen Sie einen Mac mini mit 64 GB, plus Platz für den Kontext.
Ist Ollama oder MLX auf einem Mac mini schneller?
+
Beide nutzen die Apple-GPU. MLX ist Apples eigenes Framework, Ollama lässt sich einfacher als Server betreiben. Testen Sie beide mit demselben Modell auf Ihrer eigenen Maschine.
Wie halte ich ein Modell in Ollama dauerhaft geladen?
+
Setzen Sie OLLAMA_KEEP_ALIVE mit launchctl setenv auf -1 und starten Sie die Ollama-App neu. Standardmäßig entlädt sie ein Modell nach 5 Minuten Leerlauf.