Mac miniでローカルLLMを動かす
はい、Mac miniはローカルLLMをうまく動かせます。ただし、どのモデルが動くかはメモリで決まります。16 GBのMac miniなら、約80億パラメータまでのモデルが余裕をもって載ります。300億前後のモデルには48 GBが必要です。700億なら64 GBが必要です。以下に、実際のファイルサイズ、OllamaとMLXのインストールコマンド、モデルサーバーを動かし続ける方法をまとめます。
メモリが上限になる理由
Apple siliconはユニファイドメモリを採用しています。CPUとGPUが1つのメモリ領域を共有します。GPUがRAMの大部分を使えるので、LLMには好都合です。ただし、macOS、アプリ、モデルの重み、モデルの作業用メモリは、すべて同じ領域から取られます。
作業用メモリはコンテキスト長とともに増えます。Ollamaのドキュメントによると、コンテキストが大きいほど多くのメモリが必要です。また、デフォルトのコンテキストは、使えるGPUメモリから決まります(docs.ollama.com/context-length、2026年10月)。
- 24 GiB未満:4kトークン。
- 24 GiB以上48 GiB未満:32kトークン。
- 48 GiB以上:256kトークン。
そのため、16 GBのMacは最小のコンテキストから始まります。LM Studioは、Macでは16 GB以上を推奨しています。8 GBのマシンは小さなモデルにとどめるべきだとしています(lmstudio.aiのシステム要件、2026年10月)。
当社の目安はもっと単純です。これはベンダーではなく当社の目安です。モデルのファイルを、Macのメモリより少なくとも6〜8 GB小さくします。そうすれば、macOS、コンテキスト、エージェントやブラウザの分の余裕が残ります。同じMacでビルドも動かすなら、もっと余裕を残してください。
載るモデルと実際のファイルサイズ
以下はデフォルトのビルドのダウンロードサイズです。これらのモデルでは4ビット版です。2026年10月時点のOllamaライブラリのページから取りました。
- qwen3:8bは5.2 GB、llama3.1:8bは4.9 GB。16 GBで余裕があります。
- gemma3:12bは8.1 GB、qwen3:14bは9.3 GB。16 GBではぎりぎりで、ほかのものを動かす余裕はほとんどありません。
- gpt-oss:20bは14 GB。16 GBのMacでは、macOSの分がほとんど残りません。無理だと考えてください。
- gemma3:27bは17 GB、qwen3:30bは19 GB、qwen3.5:35bは24 GB。これらには48 GBが欲しいところです。
- llama3.1:70bは43 GB。64 GBが必要です。
- gpt-oss:120bは65 GB。どのMac miniにも載りません。Mac miniのメモリは最大64 GBだからです。
小さなモデルは間違いも多くなります。下のテストでは、6億パラメータのモデルがMac miniを「a portable computer」と呼びました。動作確認には十分ですが、実際の作業には向きません。
Ollamaをインストールする
OllamaにはmacOS 14 Sonoma以降が必要です(docs.ollama.com/macos)。ダウンロードページからアプリを入手するか、インストールスクリプトを使います。macOSでは、スクリプトがOllama.appをアプリケーションフォルダに置き、ollamaコマンドをローカルのbinフォルダにリンクします。
curl -fsSL https://ollama.com/install.sh | sh
2026年10月2日に、GitHubホスト型のmacOS 26マシンで実行しました。インストールは約7秒でした。2回の実行で、最後のステップが「Unable to find application named 'Ollama'」というメッセージで失敗しました。それでもアプリはインストールされていました。パスを指定して開くと動きました。
open /Applications/Ollama.app
次に、ごく小さなモデルを取得して実行しました。
$ ollama --version ollama version is 0.35.0 $ ollama pull qwen3:0.6b $ ollama list NAME ID SIZE MODIFIED qwen3:0.6b 7df6b6e09427 522 MB Less than a second ago
実際に使うなら、メモリに収まるモデルを取得します。次に、GPUで動いていることを確認します。Processorの列が100% GPUになっているはずです。
ollama pull qwen3:8b ollama run qwen3:8b ollama ps
MLXやLM Studioを使う
MLXはApple自身の機械学習フレームワークです。LLM用のパッケージはpipでインストールできます。当社は仮想環境にインストールし、10億パラメータの4ビットモデルを実行しました。
python3 -m venv ~/mlx && source ~/mlx/bin/activate pip install mlx-lm mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40
出力は、mlx-lmのバージョン0.32.0と、ピークメモリ0.773 GBでした。大きなモデル向けに、MLXのREADMEには、GPUが確保できるメモリを増やす設定があります。macOS 15以降が必要です。Nは、モデルのサイズ(MB)より大きく、総メモリより小さくしてください。
sudo sysctl iogpu.wired_limit_mb=N
LM Studioは、モデルブラウザ付きのデスクトップアプリです。lmsコマンドがアプリに付属しています。ドキュメントでは、APIサーバーにはlms server start、ウィンドウなしで動かすにはlms daemon upを使っています。このページのために、LM Studioはテストしていません。
モデルサーバーを動かし続ける
OllamaのFAQによると、デフォルトでは、アイドル状態が5分続くとモデルをアンロードします。すると次のリクエストは、再読み込みを待つことになります。常時稼働のサーバーなら、モデルを読み込んだままにします。FAQによると、Macのアプリの変数はlaunchctlで設定し、そのあとアプリを再起動します。
launchctl setenv OLLAMA_KEEP_ALIVE "-1"
スリープもオフにします。そうしないと、Macと一緒にサーバーも凍結します。
sudo pmset -a sleep 0 sudo pmset -a disksleep 0 sudo pmset -a displaysleep 10
セキュリティについて
Ollamaは、デフォルトで127.0.0.1のポート11434で待ち受けます。当社のテストでは、APIはパスワードを一切求めませんでした。FAQには、OLLAMA_HOSTで全ネットワークから待ち受ける方法が載っています。ほかの人が到達できるMacでは、これをしないでください。ノートPCからモデルを使うなら、代わりにSSHでポートを転送します。
ssh -N -L 11434:127.0.0.1:11434 user@your-mac
そのうえで、ツールの接続先をノートPCのlocalhostのポート11434にします。Hermes AgentとOpenClawは、どちらもこうしたローカルのエンドポイントを使えます。
どのMacRunのMacが合うか
在庫のあるM6は、メモリ16 GB、SSD 256 GBです。エージェントと並べて、8Bのモデルを快適に動かせます。30Bのモデルには向きません。今のうちに、そうはっきり言っておきます。
- メモリ48 GB、SSD 1 TBのM5 Pro:エージェントプランで月額$299、別途初回のみ構築費$199がかかります。上の27B〜35Bのモデルが載ります。
- メモリ64 GB、SSD 1 TBのM5 Pro:エージェントプランで月額$349、別途初回のみ構築費$249がかかります。70Bのモデルが4ビットで載ります。
どちらも予約注文制で、約1週間で稼働します。エージェントプランでは、Claude CodeとCodexがインストール済みです。Ollama、MLX、LM Studioは、管理者権限を使ってご自身でインストールします。
ほかを探すべき人もいます。64 GBを超えるメモリが必要なら、Mac miniには載りません。当社はMac StudioやGPUサーバーを提供していません。すべてのティアは料金ページで比較できます。
よくある質問
16 GBのMac miniでローカルLLMは動きますか?
+
はい。約80億パラメータまでのモデルなら、余裕をもって載ります。たとえば5.2 GBのqwen3:8bです。120億〜140億のモデルはぎりぎりで、ほかのものに使えるメモリはほとんど残りません。
70Bのモデルにはどのくらいのメモリが必要ですか?
+
llama3.1:70bのような4ビットの70Bモデルは、Ollamaでのダウンロードが43 GBです。64 GBのMac miniが必要で、さらにコンテキストの分の余裕も要ります。
Mac miniでは、OllamaとMLXのどちらが速いですか?
+
どちらもAppleのGPUを使います。MLXはApple自身のフレームワークで、Ollamaはサーバーとして動かすのが簡単です。ご自身のマシンで、同じモデルを使って両方を試してください。
Ollamaのモデルを常に読み込んだままにするには?
+
launchctl setenvでOLLAMA_KEEP_ALIVEを-1に設定し、Ollamaのアプリを再起動します。デフォルトでは、アイドル状態が5分続くとモデルをアンロードします。