1 पॉइंट द्वारा GN⁺ 4 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Nativ MIT license वाला open-source app है, जो Apple Silicon Mac पर open AI models download करके account, subscription या cloud के बिना चलाता है
  • Google, Cohere, Liquid AI आदि के models उपलब्ध कराता है, Mac hardware के लिए उपयुक्त models recommend करता है और सभी responses locally generate करता है
  • Chat में streaming, Markdown, code highlighting और image input support है, और tokens per second व memory pressure जैसी performance स्थिति real time में देखी जा सकती है
  • MLX-VLM और M series की unified memory व Metal के लिए optimized है, और language, vision, video, code, audio tasks handle करता है
  • Local model server को Pi, Codex, Claude Code, Hermes, OpenCode से जोड़ा जा सकता है, और app व model loader का पूरा code भी public है

Mac के लिए optimized local model execution

  • Apple Silicon M1 या उससे ऊपर support करने वाला universal macOS app है, जो cloud या अलग conversion layer के बिना actual models को Mac पर चलाता है
  • Curated library से Google, Cohere, Liquid AI के open models चुन सकते हैं, और hardware के लिए उपयुक्त model recommendations भी पा सकते हैं
  • Chat interface ये features देता है
    • Streaming responses और हर message के performance metrics
    • Markdown और code syntax highlighting
    • Image input
  • Real-time performance measurement के जरिए tokens per second, memory pressure, thermal status और first token generation time देखा जा सकता है
  • MLX-VLM पर आधारित है और M series की unified memory और Metal के अनुरूप tuned है
  • LLM chat, image caption generation, video summarization, code autocomplete, speech conversion और generation support करता है
  • Account, credits या subscription की जरूरत नहीं है, और user data नहीं बेचता

Developer tools integration और open-source principles

  • Nativ के single local endpoint के जरिए existing coding agents को Mac पर चल रहे local models से connect किया जा सकता है
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • Desktop app, model loader और performance measurement charts सहित पूरा code public है, ताकि उसे देखा, fork किया और Pull Request भेजी जा सके
  • MIT license के तहत distribute किया जाता है, और VC roadmap, enterprise tiers, या prompts को training data में बदलने वाले dark patterns नहीं रखता
  • पूरी model library Hugging Face पर देखी जा सकती है

1 टिप्पणियां

 
GN⁺ 4 시간 전
Hacker News की राय
  • यह MIT लाइसेंस वाला ऐप लोकप्रिय लाइब्रेरी MLX-VLM को मेंटेन करने वाले Prince Canuma ने बनाया है। MLX-VLM लंबे समय से LM Studio जैसी चीज़ों की dependency के रूप में इस्तेमाल होता रहा है, क्योंकि यह Apple डिवाइसों पर llama.cpp से तेज़ inference दे सकता है
    MLX ecosystem, CUDA से छोटा है, लेकिन नए models, खासकर vision, speech recognition, speech synthesis, video generation जैसे multimodal models के लिए बहुत तेज़ support देता है। mlx-audio-swift भी देखने लायक है, और अगर ऐसे models इस UI में integrate हो जाएँ तो हैरानी नहीं होगी
    Landing page में vibe coding के निशान दिखें, फिर भी ऐप का ज़्यादातर हिस्सा Swift में लिखा गया है, इसलिए इस inference stack को iPad और iPhone पर port करना भी आसान लगता है

    • आजकल Hugging Face पर लगभग हर लोकप्रिय model के MLX versions मौजूद हैं। उदाहरण के लिए Qwen 3.6 35B-A3B के मुख्य पेज पर quantization links को follow करके अच्छी reputation और popularity वाला MLX variant चुन सकते हैं
    • Domain में blaizzy देखकर अच्छा लगा। Prince Canuma का MLX से जुड़ा काम लगातार बहुत high quality का रहा है
    • GitHub repository में लिखा है कि audio-only और image-generation-only model support जल्द जोड़ा जाएगा। Prince Canuma X और GitHub issues पर बहुत जल्दी जवाब देते हैं, और मैं voice cloning के लिए mlx-audio और mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16 लगभग रोज़ इस्तेमाल करता हूँ
    • मेरे मन में पहला सवाल यही आया कि Unsloth से इसमें क्या फर्क है
    • mlx-vlm में vllm या sglang की तरह modern samplers का support बहुत खराब है, इसलिए switch करना उल्टा नुकसानदेह हो सकता है। मैं min_p paper के authors में से एक हूँ, और जब llama.cpp में इससे कहीं बेहतर top-n-sigma support है, तो अगर min_p ही सबसे अच्छा विकल्प है, तब सिर्फ़ speed ज़्यादा होने से migrate करने की वजह नहीं बनती
      Modern samplers को support करने के लिए paper 1, paper 2, paper 3 से शुरुआत की जा सकती है
  • लगता है frontier शब्द का ज़रूरत से ज़्यादा इस्तेमाल हो रहा है। मैंने सोचा था इसका मतलब आज के Fable जैसे top-tier models से है, लेकिन ऐसे models को भारी RAM और महँगे GPU चाहिए, इसलिए उन्हें self-host करना आसान नहीं है

    • यहाँ शायद मतलब Pareto frontier से है, यानी multi-objective optimization problem में सबसे अच्छे solutions का set। अगर intelligence और price को आधार मानें, तो कोई model तभी frontier में होगा जब उतनी या उससे ज़्यादा intelligence सस्ते में न मिल रही हो, और उसी या कम कीमत पर उससे ज़्यादा intelligent model भी न हो
      Artificial Analysis chart देखकर यह सहज समझ आता है। उदाहरण के लिए DeepSeek V4 Pro जितना intelligent और उससे सस्ता कोई model नहीं है, इसलिए उसे frontier model कहा जा सकता है। Pareto frontier के solutions अपने class में सबसे अच्छे होते हैं, जिन्हें किसी दूसरी चीज़ की कुर्बानी दिए बिना बेहतर विकल्प से बदला नहीं जा सकता
    • इस इस्तेमाल से भ्रम पैदा होता है, इसलिए सहमत होना मुश्किल है, लेकिन आम तौर पर frontier कई हो सकते हैं, और उनमें open-weight छोटे local models का frontier सबसे अहम और दिलचस्प लगता है
      जब भी मैं Gemma 4 12B इस्तेमाल करता हूँ, लगता है यह छोटा, स्मार्ट और efficient है, फिर भी AI industry की ऊर्जा पूरी तरह गलत दिशा में जा रही है। अगर research funding को 16GB unified memory systems पर चलने वाले models को बेहतर बनाने पर केंद्रित किया जाए, तो महत्वपूर्ण प्रगति हो सकती है
      Qwen 3.6 और BottleCap के 27B fine-tuned models भी अच्छे हैं, लेकिन छोटे Gemma 4 models की चौंकाने वाली performance को पर्याप्त पहचान नहीं मिली है। यह website Qwen 3.6 27B के लिए frontier शब्द इस्तेमाल कर रही है, यह भले अनुचित लगे, पर performance के लिहाज़ से पूरी तरह बेतुका भी नहीं है
    • frontier को parameters की संख्या, task-wise performance, उसी hardware पर token generation speed, active memory requirement जैसी कई dimensions के best tradeoff से परिभाषित किया जाता है। मौजूदा विकल्पों में वह model frontier पर होगा जिसमें एक metric सुधारने पर एक या अधिक दूसरे metrics बिगड़ते हों
    • frontier एक curve है, यानी Pareto front
    • open source और cutting edge के बीच की दूरी Kimi K3 जैसे models से कम हो रही है, लेकिन Kimi K3 में 2 trillion से ज़्यादा parameters हैं। Gemma 4 जैसे models, जिन्हें एक सामान्य Mac पर सच में चलाया जा सकता है, उसी श्रेणी के नहीं हैं
  • हैरानी हुई कि homepage इसे ऐसे पेश करता है मानो LM Studio जैसे मौजूदा apps हैं ही नहीं। ऊपर-ऊपर देखने पर क्या अलग है, यह साफ़ नहीं है, और Open WebUI का ज़िक्र भी नहीं है
    मैं कई हफ्तों से MacBook Pro पर Open WebUI और DS4 के साथ DeepSeek V4 Flash को local चला रहा हूँ

    • LM Studio, Nativ developer द्वारा public किए गए code पर बना closed-source software है
    • LM Studio भी यही काम करता है, लेकिन open source नहीं है। इसलिए Nativ का एक अलग फ़ायदा है
    • “जिन दूसरे local AI apps के बारे में आपने सुना है, वे ऐसे proprietary shells हैं जो ऐसे open source engines पर बने हैं जिनके मालिक वे नहीं हैं” — यह पंक्ति LM Studio पर परोक्ष निशाना लगाती है
    • MacBook के specs जानने की जिज्ञासा है। मेरे Strix Halo पर DeepSeek V4 Flash agent के तौर पर इस्तेमाल करने के लिए बहुत धीमा है
  • अब frontier भी Claude Code यूज़र्स के लिए load-bearing जैसा एक overused शब्द बन गया है। खासकर जब यह ऐप असली top-end models को Mac पर local चला ही नहीं सकता, तो इसे कहना बंद करना चाहिए

  • “कोई और नहीं कर रहा, इसलिए हम open source हैं” जैसी marketing copy पसंद नहीं आई। मैं open-source oMLX इस्तेमाल करता हूँ, और लगता है वह Nativ की सारी functionality देता है
    अच्छा होता अगर वे उन मौजूदा open-source competitors से ठीक से तुलना करते जिन्हें उन्होंने मानो अस्तित्वहीन मान लिया

    • शायद उनका मतलब यह कहने का था कि LM Studio जैसे विकल्प open source क्यों नहीं हैं
  • यह जानने की जिज्ञासा है कि छोटे लोकल मॉडल वास्तव में कहाँ इस्तेमाल होते हैं। वे काफ़ी सक्षम हो गए हैं, लेकिन मज़े के लिए बनाए गए कुछ खिलौना प्रोजेक्ट्स के अलावा वास्तविक काम सौंपने लायक उन पर अभी भरोसा करना मुश्किल है
    यह जानना चाहता हूँ कि क्या लोग इन्हें वास्तव में coding agent में इस्तेमाल करते हैं, या ज़्यादातर किसी और काम के लिए

    • OpenCode में Qwen3.6 27B द्वारा जनरेट किया गया code मैंने production में deploy किया है। इसकी knowledge range Opus जितनी व्यापक नहीं है, लेकिन अगर prompt और आसपास के code से बदलावों का पूरा अनुमान लगाया जा सके, तो यह बहुत अच्छा काम करता है
      Blackwell GPU के लिए high-performance inference engine जैसे विशेषज्ञ ज्ञान वाले code को शुरू से लिखना मुश्किल है, लेकिन मौजूदा project में use case जोड़ने वाले सामान्य PR के लिए यह Sonnet के काफ़ी समान स्तर पर है। इसके लिए सही configuration चाहिए: recommended temperature और top-p settings, ज़रूरत से ज़्यादा न की गई quantization, और कम से कम 1.5 लाख tokens का context
    • निजी agent की memory graph extraction के लिए मैं Gemma 4 को लोकल में इस्तेमाल करता हूँ। यह messages को topic, source, fact, entity आदि में बाँटता है और NLEmbeddings का उपयोग करने वाले retrieval graph में डालता है
      target agent DeepSeek V4 Flash इस्तेमाल करता है, और लोकल मॉडल chat agent के रूप में उपयोग करने के लिए धीमा है, लेकिन memory extraction में काफ़ी अच्छा काम करता है, जिससे हर conversation turn पर API उपयोग कम हो जाता है
    • मैं इसे coding agent के रूप में नहीं इस्तेमाल करता, लेकिन text transformation, summary, और information extraction में यह बहुत उपयोगी है। अगर आप पहले से paid model subscribe किए हुए हैं, तो privacy के अलावा कोई ख़ास फ़ायदा न भी हो सकता है, लेकिन वह भी नज़रअंदाज़ करने लायक नहीं है
    • छोटे मॉडल भी dependency updates, merge conflict resolution, --help, Markdown, README लिखने जैसे दोहराए जाने वाले काम अच्छी तरह संभाल लेते हैं। असफल होने पर git restore से वापस लौटाया जा सकता है, या PR reject करके बेहतर model को फिर से दिया जा सकता है
    • Qwen35ba3b अपेक्षाकृत साधारण hardware पर भी बड़े पैमाने का data cleaning कर सकता है। दो 3090 GPU से मैं पहले ही लगभग 100 अरब tokens प्रोसेस कर चुका हूँ
  • यह जानना चाहता हूँ कि LM Studio की तुलना में इसमें क्या बेहतर है, और क्या यह MTP models भी चलाता है। मेरी जानकारी में MTP models, GGUF format में हैं

  • मैंने Rapid MLX के ज़रिए MLX इस्तेमाल किया, लेकिन Qwen बार-बार अटक रहा था और वही बात दोहरा रहा था। llama.cpp पर जाने के बाद MTP में token generation तेज़ हो गया, और मॉडल भी स्थिर था
    जानना चाहता हूँ कि दूसरों को MLX और llama.cpp की तुलना में क्या नतीजे मिले

    • M1 Max पर मुझे MLX का लगभग कोई फ़ायदा नहीं दिखा। Apple Neural Engine में हुए बदलावों की वजह से M3 या उसके बाद के versions में फ़ायदा अधिक हो सकता है
      जिन models को मैंने test किया, उनमें कुछ मामलों में llama.cpp की GGUF performance बेहतर थी। Gemma 4 का MTP बहुत मूल्यवान नहीं था, लेकिन Qwen 3.6 MoE में मापने लायक अंतर था, और नए hardware पर यह और ज़्यादा मायने रख सकता है
    • मैंने अलग-अलग समय पर MLX को दो बार test किया, लेकिन हर बार इसका performance llama.cpp से काफ़ी कम रहा
  • इस उपयोग के लिए उपयुक्त mid-range Mac specs क्या होंगे, यह जानना चाहता हूँ। 64GB M5 Pro और कम कीमत वाले M5 Air के साथ cloud token cost चुकाने के बीच सोच रहा हूँ
    कमज़ोर models को लोकल में चलाने के लिए 2,000~3,000 डॉलर अतिरिक्त खर्च करने के बजाय, उतने में काफ़ी बड़ी मात्रा में cloud tokens खरीदे जा सकते हैं

    • M1 Max 64GB पर भी ऐसे काफ़ी models चल सकते हैं
  • यह जानने की जिज्ञासा है कि ds4 के ऊपर DeepSeek V4 क्यों नहीं चलाया जाता। लगता है नतीजे काफ़ी अच्छे होंगे

    • लगता है कि Nativ, DwarfStar जैसी SSD streaming को support नहीं करता