- Nativ MIT license वाला open-source app है, जो Apple Silicon Mac पर open AI models download करके account, subscription या cloud के बिना चलाता है
- Google, Cohere, Liquid AI आदि के models उपलब्ध कराता है, Mac hardware के लिए उपयुक्त models recommend करता है और सभी responses locally generate करता है
- Chat में streaming, Markdown, code highlighting और image input support है, और tokens per second व memory pressure जैसी performance स्थिति real time में देखी जा सकती है
- MLX-VLM और M series की unified memory व Metal के लिए optimized है, और language, vision, video, code, audio tasks handle करता है
- Local model server को Pi, Codex, Claude Code, Hermes, OpenCode से जोड़ा जा सकता है, और app व model loader का पूरा code भी public है
Mac के लिए optimized local model execution
- Apple Silicon M1 या उससे ऊपर support करने वाला universal macOS app है, जो cloud या अलग conversion layer के बिना actual models को Mac पर चलाता है
- Curated library से Google, Cohere, Liquid AI के open models चुन सकते हैं, और hardware के लिए उपयुक्त model recommendations भी पा सकते हैं
- Chat interface ये features देता है
- Streaming responses और हर message के performance metrics
- Markdown और code syntax highlighting
- Image input
- Real-time performance measurement के जरिए tokens per second, memory pressure, thermal status और first token generation time देखा जा सकता है
- MLX-VLM पर आधारित है और M series की unified memory और Metal के अनुरूप tuned है
- LLM chat, image caption generation, video summarization, code autocomplete, speech conversion और generation support करता है
- Account, credits या subscription की जरूरत नहीं है, और user data नहीं बेचता
Developer tools integration और open-source principles
- Nativ के single local endpoint के जरिए existing coding agents को Mac पर चल रहे local models से connect किया जा सकता है
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Desktop app, model loader और performance measurement charts सहित पूरा code public है, ताकि उसे देखा, fork किया और Pull Request भेजी जा सके
- MIT license के तहत distribute किया जाता है, और VC roadmap, enterprise tiers, या prompts को training data में बदलने वाले dark patterns नहीं रखता
- पूरी model library Hugging Face पर देखी जा सकती है
1 टिप्पणियां
Hacker News की राय
यह MIT लाइसेंस वाला ऐप लोकप्रिय लाइब्रेरी MLX-VLM को मेंटेन करने वाले Prince Canuma ने बनाया है। MLX-VLM लंबे समय से LM Studio जैसी चीज़ों की dependency के रूप में इस्तेमाल होता रहा है, क्योंकि यह Apple डिवाइसों पर llama.cpp से तेज़ inference दे सकता है
MLX ecosystem, CUDA से छोटा है, लेकिन नए models, खासकर vision, speech recognition, speech synthesis, video generation जैसे multimodal models के लिए बहुत तेज़ support देता है। mlx-audio-swift भी देखने लायक है, और अगर ऐसे models इस UI में integrate हो जाएँ तो हैरानी नहीं होगी
Landing page में vibe coding के निशान दिखें, फिर भी ऐप का ज़्यादातर हिस्सा Swift में लिखा गया है, इसलिए इस inference stack को iPad और iPhone पर port करना भी आसान लगता है
blaizzyदेखकर अच्छा लगा। Prince Canuma का MLX से जुड़ा काम लगातार बहुत high quality का रहा हैmlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16लगभग रोज़ इस्तेमाल करता हूँModern samplers को support करने के लिए paper 1, paper 2, paper 3 से शुरुआत की जा सकती है
लगता है frontier शब्द का ज़रूरत से ज़्यादा इस्तेमाल हो रहा है। मैंने सोचा था इसका मतलब आज के Fable जैसे top-tier models से है, लेकिन ऐसे models को भारी RAM और महँगे GPU चाहिए, इसलिए उन्हें self-host करना आसान नहीं है
Artificial Analysis chart देखकर यह सहज समझ आता है। उदाहरण के लिए DeepSeek V4 Pro जितना intelligent और उससे सस्ता कोई model नहीं है, इसलिए उसे frontier model कहा जा सकता है। Pareto frontier के solutions अपने class में सबसे अच्छे होते हैं, जिन्हें किसी दूसरी चीज़ की कुर्बानी दिए बिना बेहतर विकल्प से बदला नहीं जा सकता
जब भी मैं Gemma 4 12B इस्तेमाल करता हूँ, लगता है यह छोटा, स्मार्ट और efficient है, फिर भी AI industry की ऊर्जा पूरी तरह गलत दिशा में जा रही है। अगर research funding को 16GB unified memory systems पर चलने वाले models को बेहतर बनाने पर केंद्रित किया जाए, तो महत्वपूर्ण प्रगति हो सकती है
Qwen 3.6 और BottleCap के 27B fine-tuned models भी अच्छे हैं, लेकिन छोटे Gemma 4 models की चौंकाने वाली performance को पर्याप्त पहचान नहीं मिली है। यह website Qwen 3.6 27B के लिए frontier शब्द इस्तेमाल कर रही है, यह भले अनुचित लगे, पर performance के लिहाज़ से पूरी तरह बेतुका भी नहीं है
हैरानी हुई कि homepage इसे ऐसे पेश करता है मानो LM Studio जैसे मौजूदा apps हैं ही नहीं। ऊपर-ऊपर देखने पर क्या अलग है, यह साफ़ नहीं है, और Open WebUI का ज़िक्र भी नहीं है
मैं कई हफ्तों से MacBook Pro पर Open WebUI और DS4 के साथ DeepSeek V4 Flash को local चला रहा हूँ
अब frontier भी Claude Code यूज़र्स के लिए
load-bearingजैसा एक overused शब्द बन गया है। खासकर जब यह ऐप असली top-end models को Mac पर local चला ही नहीं सकता, तो इसे कहना बंद करना चाहिए“कोई और नहीं कर रहा, इसलिए हम open source हैं” जैसी marketing copy पसंद नहीं आई। मैं open-source oMLX इस्तेमाल करता हूँ, और लगता है वह Nativ की सारी functionality देता है
अच्छा होता अगर वे उन मौजूदा open-source competitors से ठीक से तुलना करते जिन्हें उन्होंने मानो अस्तित्वहीन मान लिया
यह जानने की जिज्ञासा है कि छोटे लोकल मॉडल वास्तव में कहाँ इस्तेमाल होते हैं। वे काफ़ी सक्षम हो गए हैं, लेकिन मज़े के लिए बनाए गए कुछ खिलौना प्रोजेक्ट्स के अलावा वास्तविक काम सौंपने लायक उन पर अभी भरोसा करना मुश्किल है
यह जानना चाहता हूँ कि क्या लोग इन्हें वास्तव में coding agent में इस्तेमाल करते हैं, या ज़्यादातर किसी और काम के लिए
Blackwell GPU के लिए high-performance inference engine जैसे विशेषज्ञ ज्ञान वाले code को शुरू से लिखना मुश्किल है, लेकिन मौजूदा project में use case जोड़ने वाले सामान्य PR के लिए यह Sonnet के काफ़ी समान स्तर पर है। इसके लिए सही configuration चाहिए: recommended temperature और top-p settings, ज़रूरत से ज़्यादा न की गई quantization, और कम से कम 1.5 लाख tokens का context
target agent DeepSeek V4 Flash इस्तेमाल करता है, और लोकल मॉडल chat agent के रूप में उपयोग करने के लिए धीमा है, लेकिन memory extraction में काफ़ी अच्छा काम करता है, जिससे हर conversation turn पर API उपयोग कम हो जाता है
--help, Markdown, README लिखने जैसे दोहराए जाने वाले काम अच्छी तरह संभाल लेते हैं। असफल होने परgit restoreसे वापस लौटाया जा सकता है, या PR reject करके बेहतर model को फिर से दिया जा सकता हैयह जानना चाहता हूँ कि LM Studio की तुलना में इसमें क्या बेहतर है, और क्या यह MTP models भी चलाता है। मेरी जानकारी में MTP models, GGUF format में हैं
मैंने Rapid MLX के ज़रिए MLX इस्तेमाल किया, लेकिन Qwen बार-बार अटक रहा था और वही बात दोहरा रहा था। llama.cpp पर जाने के बाद MTP में token generation तेज़ हो गया, और मॉडल भी स्थिर था
जानना चाहता हूँ कि दूसरों को MLX और llama.cpp की तुलना में क्या नतीजे मिले
जिन models को मैंने test किया, उनमें कुछ मामलों में llama.cpp की GGUF performance बेहतर थी। Gemma 4 का MTP बहुत मूल्यवान नहीं था, लेकिन Qwen 3.6 MoE में मापने लायक अंतर था, और नए hardware पर यह और ज़्यादा मायने रख सकता है
इस उपयोग के लिए उपयुक्त mid-range Mac specs क्या होंगे, यह जानना चाहता हूँ। 64GB M5 Pro और कम कीमत वाले M5 Air के साथ cloud token cost चुकाने के बीच सोच रहा हूँ
कमज़ोर models को लोकल में चलाने के लिए 2,000~3,000 डॉलर अतिरिक्त खर्च करने के बजाय, उतने में काफ़ी बड़ी मात्रा में cloud tokens खरीदे जा सकते हैं
यह जानने की जिज्ञासा है कि ds4 के ऊपर DeepSeek V4 क्यों नहीं चलाया जाता। लगता है नतीजे काफ़ी अच्छे होंगे