Panduan

Menjalankan LLM lokal di Mac mini

Ya, Mac mini menjalankan LLM lokal dengan baik, tetapi memori yang menentukan model mana. Mac mini 16 GB memuat model hingga sekitar 8 miliar parameter dengan ruang tersisa. Model sekitar 30 miliar butuh 48 GB. 70 miliar butuh 64 GB. Di bawah ini ada ukuran file asli, perintah instalasi untuk Ollama dan MLX, dan cara menjaga server model tetap menyala.

Mengapa memori yang jadi batas

Apple silicon punya unified memory. CPU dan GPU berbagi satu pool. Itu bagus untuk LLM, karena GPU bisa memakai sebagian besar RAM. Tetapi macOS, aplikasi Anda, bobot model, dan memori kerja model semuanya diambil dari pool yang sama.

Memori kerja bertambah seiring panjang context. Dokumentasi Ollama menyebut context yang lebih besar butuh memori lebih banyak. Ollama juga memilih context default berdasarkan memori GPU yang tersedia (docs.ollama.com/context-length, Oktober 2026).

  • Di bawah 24 GiB: 4k token.
  • Dari 24 sampai 48 GiB: 32k token.
  • 48 GiB atau lebih: 256k token.

Jadi Mac 16 GB mulai dengan context terkecil. LM Studio merekomendasikan 16 GB atau lebih di Mac. Menurut LM Studio, mesin 8 GB sebaiknya tetap di model yang lebih kecil (system requirements lmstudio.ai, Oktober 2026).

Patokan kami lebih sederhana, dan ini patokan kami sendiri, bukan dari vendor. Jaga file model setidaknya 6 sampai 8 GB lebih kecil dari memori Mac. Itu menyisakan ruang untuk macOS, context, dan agen atau browser. Sisakan lebih banyak jika Anda juga menjalankan build di Mac yang sama.

Apa yang muat, dengan ukuran file asli

Ini ukuran unduhan untuk build default, yang untuk model-model ini berupa 4-bit. Angkanya dari halaman library Ollama pada Oktober 2026.

  • qwen3:8b berukuran 5.2 GB. llama3.1:8b berukuran 4.9 GB. Nyaman di 16 GB.
  • gemma3:12b berukuran 8.1 GB. qwen3:14b berukuran 9.3 GB. Di 16 GB ini pas-pasan, dengan sedikit ruang untuk hal lain.
  • gpt-oss:20b berukuran 14 GB. Di Mac 16 GB, itu hampir tidak menyisakan apa pun untuk macOS. Anggap saja tidak terjangkau.
  • gemma3:27b berukuran 17 GB, qwen3:30b 19 GB, dan qwen3.5:35b 24 GB. Model ini butuh 48 GB.
  • llama3.1:70b berukuran 43 GB. Itu butuh 64 GB.
  • gpt-oss:120b berukuran 65 GB. Model ini tidak muat di Mac mini mana pun, karena 64 GB adalah memori terbesar yang bisa dimiliki Mac mini.

Model kecil juga lebih sering salah. Dalam test kami di bawah, model 0.6 miliar parameter menyebut Mac mini "a portable computer." Cukup untuk smoke test. Tidak untuk pekerjaan sungguhan.

Instal Ollama

Ollama butuh macOS 14 Sonoma atau lebih baru (docs.ollama.com/macos). Ambil aplikasinya dari halaman unduhan, atau pakai script instalasi. Di macOS, script itu menaruh Ollama.app di Applications dan menautkan perintah ollama ke folder local bin.

curl -fsSL https://ollama.com/install.sh | sh

Kami menjalankannya di mesin macOS 26 hosted GitHub pada 2 Oktober 2026. Instalasinya sekitar 7 detik. Di dua eksekusi kami, langkah terakhir gagal dengan pesan Unable to find application named 'Ollama'. Aplikasinya tetap terpasang. Membukanya lewat path-nya berhasil.

open /Applications/Ollama.app

Lalu kami menarik model yang sangat kecil dan menjalankannya.

$ ollama --version
ollama version is 0.35.0
$ ollama pull qwen3:0.6b
$ ollama list
NAME          ID              SIZE      MODIFIED
qwen3:0.6b    7df6b6e09427    522 MB    Less than a second ago

Untuk pemakaian sungguhan, tarik model yang muat di memori Anda. Lalu cek bahwa model berjalan di GPU. Kolom Processor seharusnya menampilkan 100% GPU.

ollama pull qwen3:8b
ollama run qwen3:8b
ollama ps

Atau pakai MLX atau LM Studio

MLX adalah framework machine learning buatan Apple sendiri. Package LLM-nya dipasang dengan pip. Kami memasangnya di virtual environment dan menjalankan model 4-bit dengan 1 miliar parameter.

python3 -m venv ~/mlx && source ~/mlx/bin/activate
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40

Output-nya menampilkan mlx-lm versi 0.32.0 dan peak memory 0.773 GB. Untuk model besar, README MLX menunjukkan pengaturan yang menaikkan memori yang boleh dipegang GPU. Pengaturan itu butuh macOS 15 atau lebih baru. Jaga N di atas ukuran model dalam MB dan di bawah total RAM Anda.

sudo sysctl iogpu.wired_limit_mb=N

LM Studio adalah aplikasi desktop dengan browser model. Perintah lms ikut terpasang bersama aplikasinya. Dokumentasinya menunjukkan lms server start untuk server API dan lms daemon up untuk berjalan tanpa jendela. Kami tidak menguji LM Studio untuk halaman ini.

Jaga server model tetap berjalan

Secara default, Ollama melepas model dari memori setelah 5 menit idle, menurut FAQ-nya. Request berikutnya lalu menunggu model dimuat ulang. Untuk server yang selalu menyala, biarkan model tetap dimuat. FAQ-nya menyuruh mengatur variabel untuk aplikasi Mac dengan launchctl, lalu me-restart aplikasinya.

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

Matikan juga mode tidur, atau server ikut membeku bersama Mac.

sudo pmset -a sleep 0
sudo pmset -a disksleep 0
sudo pmset -a displaysleep 10

Catatan keamanan

Secara default, Ollama mendengarkan di 127.0.0.1 port 11434. API-nya tidak meminta password apa pun dalam test kami. FAQ-nya menunjukkan cara mendengarkan di semua jaringan dengan OLLAMA_HOST. Jangan lakukan itu di Mac yang bisa dijangkau orang lain. Untuk memakai model dari laptop Anda, teruskan port lewat SSH saja.

ssh -N -L 11434:127.0.0.1:11434 user@your-mac

Lalu arahkan tool Anda ke localhost port 11434 di laptop. Hermes Agent dan OpenClaw sama-sama bisa memakai endpoint lokal seperti ini.

Mac MacRun mana yang cocok

M6 yang tersedia di stok kami punya memori 16 GB dan SSD 256 GB. Mesin ini menjalankan model 8B dengan baik di samping agen. Mesin ini tidak tepat untuk model 30B, dan kami lebih suka mengatakannya sekarang.

  • M5 Pro dengan 48 GB dan SSD 1 TB: $299 per bulan di paket agen, ditambah biaya perakitan $199. Memuat model 27B sampai 35B di atas.
  • M5 Pro dengan 64 GB dan SSD 1 TB: $349 per bulan di paket agen, ditambah biaya perakitan $249. Memuat model 70B dalam 4-bit.

Keduanya pre-order, siap dalam sekitar satu minggu. Claude Code dan Codex sudah terpasang di paket agen. Anda memasang Ollama, MLX, atau LM Studio sendiri dengan akses admin.

Siapa yang sebaiknya mencari di tempat lain. Jika Anda butuh lebih dari 64 GB, Mac mini tidak bisa menampungnya. Kami tidak menyediakan Mac Studio atau server GPU. Bandingkan semua tier di halaman harga.

Pertanyaan yang sering diajukan

Bisakah Mac mini 16 GB menjalankan LLM lokal?

+

Bisa. Model hingga sekitar 8 miliar parameter muat dengan ruang tersisa, seperti qwen3:8b dengan 5.2 GB. Model 12 sampai 14 miliar parameter pas-pasan, dengan sedikit memori tersisa untuk hal lain.

Berapa memori yang dibutuhkan untuk model 70B?

+

Model 70B 4-bit seperti llama3.1:70b berukuran unduhan 43 GB di Ollama. Anda butuh Mac mini 64 GB untuk model itu, ditambah ruang untuk context.

Mana yang lebih cepat di Mac mini, Ollama atau MLX?

+

Keduanya memakai GPU Apple. MLX adalah framework buatan Apple sendiri, dan Ollama lebih mudah dijalankan sebagai server. Uji keduanya dengan model yang sama di mesin Anda sendiri.

Bagaimana cara menjaga model Ollama tetap dimuat sepanjang waktu?

+

Atur OLLAMA_KEEP_ALIVE ke -1 dengan launchctl setenv, lalu restart aplikasi Ollama. Secara default, Ollama melepas model setelah 5 menit idle.

Panduan terkait