ガイド

Mac miniでローカルLLMを動かす

はい、Mac miniはローカルLLMをうまく動かせます。ただし、どのモデルが動くかはメモリで決まります。16 GBのMac miniなら、約80億パラメータまでのモデルが余裕をもって載ります。300億前後のモデルには48 GBが必要です。700億なら64 GBが必要です。以下に、実際のファイルサイズ、OllamaとMLXのインストールコマンド、モデルサーバーを動かし続ける方法をまとめます。

メモリが上限になる理由

Apple siliconはユニファイドメモリを採用しています。CPUとGPUが1つのメモリ領域を共有します。GPUがRAMの大部分を使えるので、LLMには好都合です。ただし、macOS、アプリ、モデルの重み、モデルの作業用メモリは、すべて同じ領域から取られます。

作業用メモリはコンテキスト長とともに増えます。Ollamaのドキュメントによると、コンテキストが大きいほど多くのメモリが必要です。また、デフォルトのコンテキストは、使えるGPUメモリから決まります(docs.ollama.com/context-length、2026年10月)。

  • 24 GiB未満:4kトークン。
  • 24 GiB以上48 GiB未満:32kトークン。
  • 48 GiB以上:256kトークン。

そのため、16 GBのMacは最小のコンテキストから始まります。LM Studioは、Macでは16 GB以上を推奨しています。8 GBのマシンは小さなモデルにとどめるべきだとしています(lmstudio.aiのシステム要件、2026年10月)。

当社の目安はもっと単純です。これはベンダーではなく当社の目安です。モデルのファイルを、Macのメモリより少なくとも6〜8 GB小さくします。そうすれば、macOS、コンテキスト、エージェントやブラウザの分の余裕が残ります。同じMacでビルドも動かすなら、もっと余裕を残してください。

載るモデルと実際のファイルサイズ

以下はデフォルトのビルドのダウンロードサイズです。これらのモデルでは4ビット版です。2026年10月時点のOllamaライブラリのページから取りました。

  • qwen3:8bは5.2 GB、llama3.1:8bは4.9 GB。16 GBで余裕があります。
  • gemma3:12bは8.1 GB、qwen3:14bは9.3 GB。16 GBではぎりぎりで、ほかのものを動かす余裕はほとんどありません。
  • gpt-oss:20bは14 GB。16 GBのMacでは、macOSの分がほとんど残りません。無理だと考えてください。
  • gemma3:27bは17 GB、qwen3:30bは19 GB、qwen3.5:35bは24 GB。これらには48 GBが欲しいところです。
  • llama3.1:70bは43 GB。64 GBが必要です。
  • gpt-oss:120bは65 GB。どのMac miniにも載りません。Mac miniのメモリは最大64 GBだからです。

小さなモデルは間違いも多くなります。下のテストでは、6億パラメータのモデルがMac miniを「a portable computer」と呼びました。動作確認には十分ですが、実際の作業には向きません。

Ollamaをインストールする

OllamaにはmacOS 14 Sonoma以降が必要です(docs.ollama.com/macos)。ダウンロードページからアプリを入手するか、インストールスクリプトを使います。macOSでは、スクリプトがOllama.appをアプリケーションフォルダに置き、ollamaコマンドをローカルのbinフォルダにリンクします。

curl -fsSL https://ollama.com/install.sh | sh

2026年10月2日に、GitHubホスト型のmacOS 26マシンで実行しました。インストールは約7秒でした。2回の実行で、最後のステップが「Unable to find application named 'Ollama'」というメッセージで失敗しました。それでもアプリはインストールされていました。パスを指定して開くと動きました。

open /Applications/Ollama.app

次に、ごく小さなモデルを取得して実行しました。

$ ollama --version
ollama version is 0.35.0
$ ollama pull qwen3:0.6b
$ ollama list
NAME          ID              SIZE      MODIFIED
qwen3:0.6b    7df6b6e09427    522 MB    Less than a second ago

実際に使うなら、メモリに収まるモデルを取得します。次に、GPUで動いていることを確認します。Processorの列が100% GPUになっているはずです。

ollama pull qwen3:8b
ollama run qwen3:8b
ollama ps

MLXやLM Studioを使う

MLXはApple自身の機械学習フレームワークです。LLM用のパッケージはpipでインストールできます。当社は仮想環境にインストールし、10億パラメータの4ビットモデルを実行しました。

python3 -m venv ~/mlx && source ~/mlx/bin/activate
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40

出力は、mlx-lmのバージョン0.32.0と、ピークメモリ0.773 GBでした。大きなモデル向けに、MLXのREADMEには、GPUが確保できるメモリを増やす設定があります。macOS 15以降が必要です。Nは、モデルのサイズ(MB)より大きく、総メモリより小さくしてください。

sudo sysctl iogpu.wired_limit_mb=N

LM Studioは、モデルブラウザ付きのデスクトップアプリです。lmsコマンドがアプリに付属しています。ドキュメントでは、APIサーバーにはlms server start、ウィンドウなしで動かすにはlms daemon upを使っています。このページのために、LM Studioはテストしていません。

モデルサーバーを動かし続ける

OllamaのFAQによると、デフォルトでは、アイドル状態が5分続くとモデルをアンロードします。すると次のリクエストは、再読み込みを待つことになります。常時稼働のサーバーなら、モデルを読み込んだままにします。FAQによると、Macのアプリの変数はlaunchctlで設定し、そのあとアプリを再起動します。

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

スリープもオフにします。そうしないと、Macと一緒にサーバーも凍結します。

sudo pmset -a sleep 0
sudo pmset -a disksleep 0
sudo pmset -a displaysleep 10

セキュリティについて

Ollamaは、デフォルトで127.0.0.1のポート11434で待ち受けます。当社のテストでは、APIはパスワードを一切求めませんでした。FAQには、OLLAMA_HOSTで全ネットワークから待ち受ける方法が載っています。ほかの人が到達できるMacでは、これをしないでください。ノートPCからモデルを使うなら、代わりにSSHでポートを転送します。

ssh -N -L 11434:127.0.0.1:11434 user@your-mac

そのうえで、ツールの接続先をノートPCのlocalhostのポート11434にします。Hermes AgentとOpenClawは、どちらもこうしたローカルのエンドポイントを使えます。

どのMacRunのMacが合うか

在庫のあるM6は、メモリ16 GB、SSD 256 GBです。エージェントと並べて、8Bのモデルを快適に動かせます。30Bのモデルには向きません。今のうちに、そうはっきり言っておきます。

  • メモリ48 GB、SSD 1 TBのM5 Pro:エージェントプランで月額$299、別途初回のみ構築費$199がかかります。上の27B〜35Bのモデルが載ります。
  • メモリ64 GB、SSD 1 TBのM5 Pro:エージェントプランで月額$349、別途初回のみ構築費$249がかかります。70Bのモデルが4ビットで載ります。

どちらも予約注文制で、約1週間で稼働します。エージェントプランでは、Claude CodeとCodexがインストール済みです。Ollama、MLX、LM Studioは、管理者権限を使ってご自身でインストールします。

ほかを探すべき人もいます。64 GBを超えるメモリが必要なら、Mac miniには載りません。当社はMac StudioやGPUサーバーを提供していません。すべてのティアは料金ページで比較できます。

よくある質問

16 GBのMac miniでローカルLLMは動きますか?

+

はい。約80億パラメータまでのモデルなら、余裕をもって載ります。たとえば5.2 GBのqwen3:8bです。120億〜140億のモデルはぎりぎりで、ほかのものに使えるメモリはほとんど残りません。

70Bのモデルにはどのくらいのメモリが必要ですか?

+

llama3.1:70bのような4ビットの70Bモデルは、Ollamaでのダウンロードが43 GBです。64 GBのMac miniが必要で、さらにコンテキストの分の余裕も要ります。

Mac miniでは、OllamaとMLXのどちらが速いですか?

+

どちらもAppleのGPUを使います。MLXはApple自身のフレームワークで、Ollamaはサーバーとして動かすのが簡単です。ご自身のマシンで、同じモデルを使って両方を試してください。

Ollamaのモデルを常に読み込んだままにするには?

+

launchctl setenvでOLLAMA_KEEP_ALIVEを-1に設定し、Ollamaのアプリを再起動します。デフォルトでは、アイドル状態が5分続くとモデルをアンロードします。

関連ガイド