गाइड

Mac mini पर लोकल LLM चलाना

हाँ, Mac mini लोकल LLM अच्छी तरह चलाता है, पर कौन से, यह मेमोरी तय करती है। 16 GB वाले Mac mini में लगभग 8 billion parameters तक के मॉडल आराम से आ जाते हैं। लगभग 30 billion वाले मॉडल को 48 GB चाहिए। 70 billion को 64 GB चाहिए। नीचे असली फ़ाइल साइज़ हैं, Ollama और MLX की install कमांड हैं, और मॉडल सर्वर चालू रखने का तरीका है।

मेमोरी ही सीमा क्यों है

Apple silicon में unified memory होती है। CPU और GPU एक ही पूल शेयर करते हैं। LLM के लिए यह अच्छा है, क्योंकि GPU ज़्यादातर RAM इस्तेमाल कर सकता है। पर macOS, आपके ऐप, मॉडल weights और मॉडल की working memory, सब उसी पूल से आते हैं।

working memory, context length के साथ बढ़ती है। Ollama के डॉक्स कहते हैं कि बड़े context को ज़्यादा मेमोरी चाहिए। वे उपलब्ध GPU मेमोरी के हिसाब से डिफ़ॉल्ट context भी चुनते हैं (docs.ollama.com/context-length, अक्टूबर 2026)।

  • 24 GiB से कम: 4k tokens।
  • 24 से 48 GiB तक: 32k tokens।
  • 48 GiB या ज़्यादा: 256k tokens।

तो 16 GB वाला Mac सबसे छोटे context से शुरू करता है। LM Studio, Mac पर 16 GB या ज़्यादा की सलाह देता है। उसके अनुसार 8 GB वाली मशीनों को छोटे मॉडल तक रहना चाहिए (lmstudio.ai system requirements, अक्टूबर 2026)।

हमारा मोटा नियम आसान है, और यह हमारा है, किसी vendor का नहीं। मॉडल फ़ाइल को Mac की मेमोरी से कम से कम 6 से 8 GB छोटा रखें। इससे macOS, context, और एक एजेंट या ब्राउज़र के लिए जगह बचती है। अगर उसी Mac पर बिल्ड भी चलते हैं, तो ज़्यादा जगह छोड़ें।

क्या आता है, असली फ़ाइल साइज़ के साथ

ये डिफ़ॉल्ट बिल्ड के डाउनलोड साइज़ हैं, जो इन मॉडल के लिए 4-bit हैं। ये अक्टूबर 2026 के Ollama library पेज से हैं।

  • qwen3:8b 5.2 GB है। llama3.1:8b 4.9 GB है। 16 GB पर आराम से चलते हैं।
  • gemma3:12b 8.1 GB है। qwen3:14b 9.3 GB है। 16 GB पर ये मुश्किल से आते हैं, और बाकी किसी चीज़ के लिए कम जगह बचती है।
  • gpt-oss:20b 14 GB है। 16 GB वाले Mac पर इससे macOS के लिए लगभग कुछ नहीं बचता। इसे पहुँच से बाहर मानें।
  • gemma3:27b 17 GB है, qwen3:30b 19 GB है और qwen3.5:35b 24 GB है। इन्हें 48 GB चाहिए।
  • llama3.1:70b 43 GB है। इसे 64 GB चाहिए।
  • gpt-oss:120b 65 GB है। यह किसी भी Mac mini में नहीं आता, क्योंकि Mac mini में ज़्यादा से ज़्यादा 64 GB होती है।

छोटे मॉडल गलतियाँ भी ज़्यादा करते हैं। नीचे के हमारे टेस्ट में, 0.6 billion parameter वाले मॉडल ने Mac mini को "a portable computer" कहा। smoke test के लिए ठीक है। असली काम के लिए नहीं।

Ollama इंस्टॉल करें

Ollama को macOS 14 Sonoma या नया चाहिए (docs.ollama.com/macos)। ऐप डाउनलोड पेज से लें, या install स्क्रिप्ट इस्तेमाल करें। macOS पर स्क्रिप्ट Ollama.app को Applications में रखती है और ollama कमांड को local bin फ़ोल्डर में link करती है।

curl -fsSL https://ollama.com/install.sh | sh

हमने इसे 2 अक्टूबर 2026 को GitHub की होस्टेड macOS 26 मशीनों पर चलाया। यह लगभग 7 सेकंड में इंस्टॉल हुआ। हमारे दो रन में आखिरी कदम इस मैसेज के साथ फ़ेल हुआ: Unable to find application named 'Ollama'। ऐप फिर भी इंस्टॉल हो गया था। उसे उसके path से खोलने पर काम बन गया।

open /Applications/Ollama.app

फिर हमने एक बहुत छोटा मॉडल pull करके चलाया।

$ ollama --version
ollama version is 0.35.0
$ ollama pull qwen3:0.6b
$ ollama list
NAME          ID              SIZE      MODIFIED
qwen3:0.6b    7df6b6e09427    522 MB    Less than a second ago

असली इस्तेमाल के लिए ऐसा मॉडल pull करें जो आपकी मेमोरी में आए। फिर जाँचें कि यह GPU पर चलता है। Processor कॉलम में 100% GPU लिखा होना चाहिए।

ollama pull qwen3:8b
ollama run qwen3:8b
ollama ps

या MLX या LM Studio इस्तेमाल करें

MLX, Apple का अपना machine learning framework है। इसका LLM package pip से इंस्टॉल होता है। हमने इसे एक virtual environment में इंस्टॉल किया और 1 billion parameter वाला 4-bit मॉडल चलाया।

python3 -m venv ~/mlx && source ~/mlx/bin/activate
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "What is a Mac mini?" --max-tokens 40

इसने mlx-lm वर्ज़न 0.32.0 और 0.773 GB की peak memory प्रिंट की। बड़े मॉडल के लिए MLX README एक सेटिंग दिखाता है, जो GPU के रखने लायक मेमोरी बढ़ाती है। इसके लिए macOS 15 या नया चाहिए। N को MB में मॉडल साइज़ से ऊपर और अपनी कुल RAM से नीचे रखें।

sudo sysctl iogpu.wired_limit_mb=N

LM Studio एक डेस्कटॉप ऐप है, जिसमें मॉडल ब्राउज़र है। इसकी lms कमांड ऐप के साथ आती है। डॉक्स API सर्वर के लिए lms server start दिखाते हैं, और विंडो के बिना चलाने के लिए lms daemon up। इस पेज के लिए हमने LM Studio टेस्ट नहीं किया।

मॉडल सर्वर को चालू रखें

Ollama के FAQ के अनुसार, डिफ़ॉल्ट रूप से यह 5 मिनट idle रहने पर मॉडल unload कर देता है। फिर अगली रिक्वेस्ट को reload का इंतज़ार करना पड़ता है। हमेशा चालू सर्वर के लिए मॉडल लोड रखें। FAQ कहता है कि Mac ऐप के लिए variables launchctl से सेट करें, फिर ऐप रीस्टार्ट करें।

launchctl setenv OLLAMA_KEEP_ALIVE "-1"

स्लीप भी बंद करें, वरना Mac के साथ सर्वर भी जम जाता है।

sudo pmset -a sleep 0
sudo pmset -a disksleep 0
sudo pmset -a displaysleep 10

सुरक्षा से जुड़ी बातें

Ollama डिफ़ॉल्ट रूप से 127.0.0.1 के पोर्ट 11434 पर सुनता है। हमारे टेस्ट में इसके API ने कोई पासवर्ड नहीं माँगा। FAQ दिखाता है कि OLLAMA_HOST से सभी नेटवर्क पर कैसे सुनें। ऐसे Mac पर यह न करें जिस तक दूसरे लोग पहुँच सकते हों। अपने लैपटॉप से मॉडल इस्तेमाल करने के लिए, इसके बजाय पोर्ट को SSH से forward करें।

ssh -N -L 11434:127.0.0.1:11434 user@your-mac

फिर अपने टूल को लैपटॉप पर localhost के पोर्ट 11434 पर लगाएँ। Hermes Agent और OpenClaw, दोनों ऐसा लोकल endpoint इस्तेमाल कर सकते हैं।

कौन सा MacRun Mac ठीक बैठता है

स्टॉक में मौजूद हमारे M6 में 16 GB मेमोरी और 256 GB SSD है। यह एजेंट के साथ 8B मॉडल अच्छी तरह चलाता है। 30B मॉडल के लिए यह गलत मशीन है, और हम यह अभी बता देना बेहतर समझते हैं।

  • 48 GB और 1 TB SSD वाला M5 Pro: एजेंट प्लान पर $299 प्रति माह, साथ में $199 बिल्ड फ़ीस। ऊपर के 27B से 35B वाले मॉडल इसमें आते हैं।
  • 64 GB और 1 TB SSD वाला M5 Pro: एजेंट प्लान पर $349 प्रति माह, साथ में $249 बिल्ड फ़ीस। 4-bit पर 70B मॉडल इसमें आते हैं।

दोनों प्री-ऑर्डर हैं, लगभग एक हफ़्ते में तैयार। एजेंट प्लान पर Claude Code और Codex इंस्टॉल आते हैं। Ollama, MLX या LM Studio आप अपने एडमिन अधिकारों से खुद इंस्टॉल करते हैं।

किसे कहीं और देखना चाहिए। अगर आपको 64 GB से ज़्यादा चाहिए, तो Mac mini में वह नहीं आ सकता। हम Mac Studio या GPU सर्वर नहीं देते। सभी टियर की तुलना प्राइसिंग पेज पर करें।

अक्सर पूछे जाने वाले सवाल

क्या 16 GB वाला Mac mini लोकल LLM चला सकता है?

+

हाँ। लगभग 8 billion parameters तक के मॉडल आराम से आ जाते हैं, जैसे 5.2 GB वाला qwen3:8b। 12 से 14 billion वाले मॉडल मुश्किल से आते हैं, और बाकी किसी चीज़ के लिए कम मेमोरी बचती है।

70B मॉडल के लिए कितनी मेमोरी चाहिए?

+

llama3.1:70b जैसा 4-bit 70B मॉडल Ollama पर 43 GB का डाउनलोड है। इसके लिए 64 GB वाला Mac mini चाहिए, और context के लिए जगह भी।

Mac mini पर Ollama तेज़ है या MLX?

+

दोनों Apple GPU इस्तेमाल करते हैं। MLX, Apple का अपना framework है, और Ollama को सर्वर के रूप में चलाना आसान है। अपनी मशीन पर एक ही मॉडल से दोनों को टेस्ट करें।

Ollama मॉडल को हर समय लोड कैसे रखूँ?

+

launchctl setenv से OLLAMA_KEEP_ALIVE को -1 पर सेट करें और Ollama ऐप रीस्टार्ट करें। डिफ़ॉल्ट रूप से यह 5 मिनट idle रहने पर मॉडल unload कर देता है।

संबंधित गाइड