Как запустить локальную LLM на Mac mini
Да, Mac mini хорошо запускает локальные LLM, но какие именно, решает память. В Mac mini с 16 GB с запасом помещаются модели примерно до 8 миллиардов параметров. Моделям около 30 миллиардов нужно 48 GB. Для 70 миллиардов нужно 64 GB. Ниже реальные размеры файлов, команды установки Ollama и MLX и способ держать сервер модели включённым.
Почему всё упирается в память
У Apple silicon объединённая память. CPU и GPU делят один общий объём. Для LLM это хорошо, потому что GPU может использовать большую часть RAM. Но macOS, ваши приложения, веса модели и рабочая память модели берутся из того же объёма.
Рабочая память растёт с длиной контекста. В документации Ollama сказано, что большему контексту нужно больше памяти. Контекст по умолчанию Ollama выбирает по доступной памяти GPU (docs.ollama.com/context-length, октябрь 2026 года).
- Меньше 24 GiB: 4k токенов.
- От 24 до 48 GiB: 32k токенов.
- 48 GiB и больше: 256k токенов.
Так что Mac с 16 GB стартует с самым маленьким контекстом. LM Studio рекомендует на Mac 16 GB или больше. По его словам, машинам с 8 GB лучше ограничиться небольшими моделями (системные требования lmstudio.ai, октябрь 2026 года).
Наше практическое правило проще, и оно наше, а не производителя. Файл модели должен быть меньше памяти Mac как минимум на величину от 6 до 8 GB. Так остаётся место для macOS, контекста и агента или браузера. Оставьте больше, если на том же Mac идут ещё и сборки.
Что помещается: реальные размеры файлов
Это размеры загрузки для сборок по умолчанию, у этих моделей они 4-битные. Данные взяты со страниц библиотеки Ollama в октябре 2026 года.
- qwen3:8b весит 5.2 GB. llama3.1:8b весит 4.9 GB. На 16 GB им комфортно.
- gemma3:12b весит 8.1 GB. qwen3:14b весит 9.3 GB. На 16 GB это впритык, места для чего-то ещё почти нет.
- gpt-oss:20b весит 14 GB. На Mac с 16 GB для macOS почти ничего не остаётся. Считайте, что эта модель недоступна.
- gemma3:27b весит 17 GB, qwen3:30b весит 19 GB, а qwen3.5:35b весит 24 GB. Им нужно 48 GB.
- llama3.1:70b весит 43 GB. Ей нужно 64 GB.
- gpt-oss:120b весит 65 GB. Она не помещается ни в один Mac mini, потому что 64 GB это максимум памяти для Mac mini.
Маленькие модели к тому же чаще ошибаются. В нашем тесте ниже модель на 0.6 миллиарда параметров назвала Mac mini "a portable computer", то есть портативным компьютером. Для проверки, что всё запускается, сойдёт. Для настоящей работы нет.
Установка Ollama
Ollama требует macOS 14 Sonoma или новее (docs.ollama.com/macos). Скачайте приложение со страницы загрузки или используйте скрипт установки. На macOS скрипт кладёт Ollama.app в «Программы» и создаёт ссылку на команду ollama в локальной папке bin.
curl -fsSL https://ollama.com/install.sh | sh
Мы запускали его на машинах macOS 26 от GitHub 2 октября 2026 года. Установка заняла около 7 секунд. В двух наших запусках последний шаг падал с сообщением Unable to find application named 'Ollama'. При этом приложение всё равно было установлено. Помогло открыть его по пути.
open /Applications/Ollama.app
Затем мы скачали крошечную модель и запустили её.
$ ollama --version ollama version is 0.35.0 $ ollama pull qwen3:0.6b $ ollama list NAME ID SIZE MODIFIED qwen3:0.6b 7df6b6e09427 522 MB Less than a second ago
Для реальной работы скачайте модель, которая помещается в вашу память. Затем проверьте, что она работает на GPU. В колонке Processor должно быть 100% GPU.
ollama pull qwen3:8b ollama run qwen3:8b ollama ps
Или MLX и LM Studio
MLX это собственный фреймворк машинного обучения от Apple. Его пакет для LLM ставится через pip. Мы установили его в виртуальное окружение и запустили 4-битную модель на 1 миллиард параметров.
python3 -m venv ~/mlx && source ~/mlx/bin/activate pip install mlx-lm mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40
Он вывел версию mlx-lm 0.32.0 и пиковое потребление памяти 0.773 GB. Для больших моделей в README MLX есть настройка, которая увеличивает объём памяти, доступный GPU. Ей нужна macOS 15 или новее. Значение N должно быть больше размера модели в MB и меньше всего объёма RAM.
sudo sysctl iogpu.wired_limit_mb=N
LM Studio это настольное приложение с каталогом моделей. Его команда lms поставляется вместе с приложением. В документации показаны lms server start для API-сервера и lms daemon up для работы без окна. Для этой страницы мы LM Studio не тестировали.
Сервер модели, который не останавливается
По умолчанию Ollama выгружает модель после 5 минут простоя, как сказано в его FAQ. Следующий запрос тогда ждёт повторной загрузки. Для всегда включённого сервера держите модели загруженными. FAQ советует задать переменные для приложения на Mac через launchctl, а затем перезапустить приложение.
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
Отключите и сон, иначе сервер замрёт вместе с Mac.
sudo pmset -a sleep 0 sudo pmset -a disksleep 0 sudo pmset -a displaysleep 10
Безопасность
По умолчанию Ollama слушает 127.0.0.1 на порту 11434. В нашем тесте его API не спрашивал никакого пароля. В FAQ показано, как слушать все сети через OLLAMA_HOST. Не делайте этого на Mac, до которого могут добраться другие люди. Чтобы пользоваться моделью со своего ноутбука, лучше пробросьте порт через SSH.
ssh -N -L 11434:127.0.0.1:11434 user@your-mac
Затем направьте свои инструменты на localhost, порт 11434, на своём ноутбуке. Hermes Agent и OpenClaw оба умеют работать с таким локальным endpoint.
Какой Mac от MacRun подойдёт
У нашего M6 из наличия 16 GB памяти и SSD на 256 GB. Он хорошо запускает модели на 8B рядом с агентом. Для моделей на 30B это неподходящая машина, и мы лучше скажем это сразу.
- M5 Pro с 48 GB и SSD на 1 TB: $299 в месяц на тарифе «Агент», плюс разовая плата за сборку $199. Подходит для моделей от 27B до 35B из списка выше.
- M5 Pro с 64 GB и SSD на 1 TB: $349 в месяц на тарифе «Агент», плюс разовая плата за сборку $249. Подходит для моделей на 70B в 4-битном виде.
Обе конфигурации доступны по предзаказу и готовы примерно через неделю. На тарифе «Агент» Claude Code и Codex установлены. Ollama, MLX или LM Studio вы ставите сами с правами администратора.
Кому стоит поискать в другом месте. Если вам нужно больше 64 GB, Mac mini столько не вмещает. Mac Studio и серверы с GPU мы не предлагаем. Все конфигурации сравниваются на странице цен.
Частые вопросы
Можно ли запустить локальную LLM на Mac mini с 16 GB?
+
Да. Модели примерно до 8 миллиардов параметров помещаются с запасом, например qwen3:8b на 5.2 GB. Модели от 12 до 14 миллиардов помещаются впритык, и памяти почти ни на что больше не остаётся.
Сколько памяти нужно для модели на 70B?
+
4-битная модель на 70B, например llama3.1:70b, весит в Ollama 43 GB. Для неё нужен Mac mini с 64 GB и ещё место под контекст.
Что быстрее на Mac mini, Ollama или MLX?
+
Оба используют GPU Apple. MLX это собственный фреймворк Apple, а Ollama проще запустить как сервер. Проверьте оба с одной и той же моделью на своей машине.
Как держать модель Ollama всё время загруженной?
+
Задайте OLLAMA_KEEP_ALIVE равным -1 через launchctl setenv и перезапустите приложение Ollama. По умолчанию оно выгружает модель после 5 минут простоя.