1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • पर्याप्त प्रदर्शन और portability वाले open weight models डेवलपर, cloud और enterprise के साथ मिलकर scale होने की बुनियाद बन सकते हैं, जिससे ऐसा innovation ecosystem बनता है जिसका मुकाबला किसी एक vendor के लिए करना मुश्किल है
  • जैसे Kubernetes ने common interface के ऊपर networking, storage और observability tools को जोड़ा, वैसे ही AI में model serving, fine-tuning, agent runtime और evaluation तक जाने वाला production stack बढ़ रहा है
  • Hugging Face पर public models की संख्या 20 लाख से आगे निकल चुकी है, GLM-5.2 ने अपनी SWE-bench Pro evaluation में 62.1% हासिल किया जो GPT-5.5 के 58.6% से आगे है, और Kimi K3 ने independent evaluation में Opus 4.8 और GPT-5.5 के समान स्कोर पाया
  • अगर चीनी open weight models पर व्यापक प्रतिबंध लगाया जाता है, तो दुनिया में विकास जारी रहेगा लेकिन अमेरिकी शोधकर्ता और कंपनियां ही ecosystem से बाहर हो जाएंगी, और पिछले 1 साल में Hugging Face downloads के 41% हिस्से वाले चीनी models के आसपास innovation जमा हो सकता है
  • अमेरिका को प्रतिबंध के बजाय commercial उपयोग के लिए frontier models जारी करने, portability और interoperability को महत्व देने वाली government procurement, पूरे tools और operations layer का निर्माण, और independent safety testing और standards के साथ प्रतिस्पर्धा करनी चाहिए

Kubernetes ने खुला platform की ताकत कैसे दिखाई

  • Mesosphere ने Apache Mesos पर आधारित open source cloud-native software विकसित किया और उसके आसपास DC/OS बनाकर support और proprietary features वाले enterprise distribution के रूप में commercialize किया
  • बाद में इससे नया और अधिक पूर्ण open source project Kubernetes आया, जिसने cloud-native community को एकजुट किया और Mesosphere को हिला दिया
    • दुनिया भर के distributed systems और infrastructure engineers ने Kubernetes पर अपना करियर दांव पर लगाया, और Mesosphere community के कुछ वफादार सदस्य भी उधर चले गए
    • innovation का केंद्र Kubernetes की ओर शिफ्ट होते ही networking, storage, observability, deployment tools और policy engines जैसे पहले से कमज़ोर हिस्से तेजी से विकसित हुए
  • कई startups और मौजूदा vendors के जुड़ने से Kubernetes को production में चलाने के लिए ज़रूरी लगभग हर component open source के रूप में उपलब्ध हो गया
    • cloud providers, Mesosphere/D2iQ, Rancher, Red Hat और Nutanix ने integration, enterprise features, support और operations के आसपास business बनाया
  • Kubernetes की सफलता सिर्फ repository public कर देने का नतीजा नहीं थी
    • यह engineers, cloud providers और enterprise vendors के लिए ग्राहक ज़रूरतों के हिसाब से विस्तार करने योग्य neutral foundation बन गया
    • common interfaces और vendor-neutral governance ने प्रतिभागियों को यह भरोसा दिया कि वे लंबे समय के लिए products बना सकते हैं
  • जब customizable open platform किसी industry का केंद्र बन जाता है, तो किसी एक vendor के लिए पूरे ecosystem की combined innovation speed का पीछा करना मुश्किल हो जाता है

Open weight और open source AI में अंतर

  • जिन्हें अक्सर open source कहा जाता है, ऐसे ज़्यादातर models वास्तव में open weight models हैं
    • इनके trained parameters डाउनलोड और modify किए जा सकते हैं, लेकिन training data और पूरी training process आमतौर पर public नहीं होती
    • इसलिए ये Open Source Initiative की open source AI definition पर खरे नहीं उतरते
  • पूरी तरह open source न होने पर भी, ऐसे outputs के आसपास ecosystem बन सकता है जिन्हें user चला और modify कर सके
  • Kubernetes और AI की संरचना में महत्वपूर्ण अंतर भी हैं
    • Kubernetes contributors असली source code की जांच और बदलाव कर सकते थे, और improvements को shared upstream project में वापस भेज सकते थे
    • model fine-tuning के नतीजे आमतौर पर उसी तरह साझा नहीं किए जाते
    • frontier model के weights डाउनलोड किए जा सकें, तब भी उन्हें चलाने के लिए महंगा hardware चाहिए हो सकता है
    • AI में CNCF जैसी कोई संस्था नहीं है जो neutral governance और common interfaces दे
  • दोनों ecosystems की समानता यह है कि पर्याप्त प्रदर्शन और portability वाली बुनियाद, मूल निर्माता की अकेले बनाने की क्षमता से आगे बढ़कर complementary innovation को आकर्षित करती है

Self-hosting से model platform तक

  • open weight models अपनाने की पहली वजह self-hosting थी
    • enterprises अपनी data पर सीधा नियंत्रण रखते हुए अपने cloud या data center में models चलाना चाहते थे
    • usage और inference cost बढ़ने के साथ cost को सीधे नियंत्रित करने की मांग भी बढ़ी
  • इसी मांग के आधार पर vLLM, SGLang, llama.cpp, Ollama और MLX जैसे open source model serving stacks बने
  • open weight, self-hosting से आगे बढ़कर डेवलपर्स को खुद model modify और redistribute करने देता है
  • Hugging Face पर 20 लाख से अधिक public models registered हैं
  • Qwen और Gemma जैसी लोकप्रिय model families के आसपास कई तरह के derived outputs बन रहे हैं
    • अलग-अलग semiconductor architectures और scales के लिए quantized और converted weights
    • coding, medicine, law, math और agent workflows के लिए fine-tuned models और LoRA adapters
    • अलग-अलग fine-tuning results को मिलाकर model merging
    • TensorRT-LLM, vLLM, MLX जैसे अलग-अलग runtimes के लिए model variants

Frontier और घटता performance gap

  • पहले open models का base performance सबसे कठिन coding और agent tasks के लिए कमज़ोर था, इसलिए उन्हें frontier race से बाहर मानना आसान था, लेकिन यह gap तेजी से घट रहा है
  • Z.ai ने MIT license के तहत open weights वाला GLM-5.2 जारी किया
    • इसकी अपनी evaluation में SWE-bench Pro score 62.1% रहा, जो GPT-5.5 के 58.6% से अधिक है
    • हालांकि results benchmark और agent harness के हिसाब से बदल सकते हैं
  • Moonshot ने कहा कि Kimi K3 लंबी coding tasks में closed frontier models के करीब पहुंचता है, और 27 जुलाई को weights जारी करने का वादा किया
  • जब base models का प्रदर्शन पर्याप्त हो जाता है, तो agent runtimes, coding harnesses, sandboxes, evaluation, observability और specialized fine-tuning projects श्रृंखलाबद्ध तरीके से बढ़ सकते हैं
  • ये components मिलकर ऐसा production-grade open stack बनाते हैं जिसे टीम के workload, hardware और cost structure के हिसाब से adjust किया जा सकता है
    • इसमें open weight models, open source software के ऊपर चलाए जाते हैं
    • यह गारंटी नहीं देता कि हर benchmark में हर closed model को हरा देगा
  • frontier AI, talent competition है, और open ecosystem दुनिया भर की प्रतिभा को एक ही foundation पर build करने की वजह देता है

चीनी models पर प्रतिबंध का अमेरिका पर असर

  • Kimi K3 जैसे शक्तिशाली चीनी models के आने के बाद, बताया गया है कि Trump administration चीनी open weight models पर पाबंदियों पर विचार कर रहा है
    • संभावित प्रतिबंध किस रूप में होगा, यह अभी स्पष्ट नहीं है
  • अगर चीनी open weight models के उपयोग पर व्यापक रोक लगती है, तो अमेरिकी शोधकर्ता और कंपनियां खुद को उस ecosystem से अलग कर सकती हैं जहां दुनिया के AI researchers और engineers जुट रहे हैं
    • इस ecosystem में कई चीनी शोधकर्ता भी शामिल हैं
    • दुनिया भर में development जारी रहेगा, लेकिन अमेरिकी डेवलपर्स ही उससे वंचित रहेंगे
  • Qwen के आसपास यही रुझान पहले से दिख रहा है
    • Hugging Face के अनुसार पिछले 1 साल में चीनी models का हिस्सा कुल model downloads का 41% रहा
  • अगर सबसे बेहतर open weight base models चीन से आते रहे, तो Kubernetes की तरह उन्हीं models के आसपास tools और innovation जमा हो सकते हैं

अमेरिका चार तरीकों से कैसे प्रतिस्पर्धा कर सकता है

  • Frontier-स्तर के अमेरिकी models जारी करना

    • अमेरिकी labs को ऐसे license के साथ frontier-grade open weight models जारी करने चाहिए जिन पर startups वास्तविक products बना सकें
    • कुछ प्रगति पहले से दिख रही है
    • NVIDIA Nemotron को NVIDIA के permissive license के तहत commercial उपयोग के लिए उपलब्ध कराया गया है
    • Thinking Machines का Inkling, OpenAI का gpt-oss, और Google का Gemma 4 Apache 2.0 के तहत जारी किए गए हैं
    • लेकिन OpenAI और Google के सर्वोच्च प्रदर्शन वाले models सहित अमेरिका की ज़्यादातर frontier labs के सबसे ताकतवर models अब भी closed हैं
  • Government procurement से open market बनाना

    • government procurement को ऐसे systems की मांग बनानी चाहिए जिनमें portability और interoperability हो, न कि ऐसे systems की जो हमेशा के लिए एक API vendor पर निर्भर हों
    • अमेरिकी रक्षा विभाग पहले से ऐसा ही approach इस्तेमाल करता है
    • Platform One open source tools और enterprise products देता है जिन पर कई military programs build कर सकते हैं
    • इसी procurement approach से open weight models के आसपास innovation तेज किया जा सकता है
  • Models से परे पूरा stack बनाना

    • अमेरिकी कंपनियों को models के आसपास की बाकी layers भी बनानी होंगी
    • startups models को customize, scale और products में embed कर सकते हैं
    • serving, tools, support और operations layers भी business opportunity हैं
    • अमेरिका की प्रमुख semiconductor कंपनियां hardware को लगातार बेहतर बना सकती हैं, और hyperscalers व neoclouds models और ecosystem को service के रूप में दे सकते हैं
  • प्रतिबंध के बजाय testing और standards लाना

    • safety, restrictions के समर्थन का सबसे मजबूत तर्क है, लेकिन पूर्ण प्रतिबंध बहुत व्यापक है और पूरे ecosystem तक पहुंच की कीमत पर आता है
    • बेहतर जवाब यह होगा कि frontier models के लिए independent testing और standards तैयार किए जाएं
    • Kubernetes conformance testing safety नहीं बल्कि compatibility को verify करती है, इसलिए यह AI के लिए पूरी तरह समान उदाहरण नहीं है
    • फिर भी independent criteria और governance model से सीख ली जा सकती है
    • Demis Hassabis ने इसी तरह की अमेरिका-नेतृत्व वाली independent standards body का प्रस्ताव दिया है

Open AI ecosystem में प्रतिस्पर्धा की रणनीति

  • अमेरिका को अपने डेवलपर्स के आसपास दीवारें खड़ी करने के बजाय चीनी models को सीधे चलाना, उनके अंदरूनी हिस्सों का विश्लेषण करना, benchmark करना और उन्हें बेहतर बनाना चाहिए
  • साथ ही उसे बेहतर अमेरिकी विकल्प बनाने चाहिए ताकि अमेरिकी AI stack दुनिया में अपनाने के लिए सबसे आसान विकल्प बन सके
  • अमेरिका दशकों से दुनिया की सर्वश्रेष्ठ tech talent को आकर्षित और विकसित करने की जगह देता आया है
  • अगर दूसरे देश अधिक खुले stacks को standard के रूप में अपनाते रहें और अमेरिका अपनी इस बढ़त को closed ecosystem में बदल दे, तो वह AI leader की अपनी स्थिति खुद छोड़ देगा

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • चीनी मॉडल पर प्रतिबंध तकनीकी रूप से असंभव लगता है। weights आखिर सिर्फ numbers हैं, इसलिए अमेरिकी और चीनी weights में फर्क नहीं किया जा सकता, और source-आधारित प्रतिबंध को आसानी से bypass किया जा सकता है
    आखिरकार सभी public-weight models को regulate करना पड़ेगा, और Axios की रिपोर्ट के अनुसार प्रमुख AI labs या संबंधित लोगों ने हर 3~5 महीने में प्रशासन को open source models पर प्रतिबंध का प्रस्ताव भी दिया है
    DRM जैसी license व्यवस्था लागू करके सिर्फ प्रमाणित अमेरिकी models को अपने servers पर चलाने की अनुमति दी जा सकती है, लेकिन इससे बड़े labs को monopoly मिल जाएगी और derived models के वितरण पर भी रोक लगेगी। विदेशों में इसे लागू करना मुश्किल होगा, इसलिए आखिर में संभव है कि सिर्फ अमेरिकी नागरिक ही सीमित रह जाएँ

    • open source models पर प्रतिबंध, जैसे software के साथ हुआ था, जल्दी ही First Amendment से टकराएगा। आधुनिक DeCSS झंडा शायद इस तरह के text के रूप में होगा: “मेरा मानना है कि अच्छे weights {...weights go here...} हैं”
      इसके बजाय चीनी कंपनियों या चीनी स्वामित्व वाली कंपनियों को inference/AI services के लिए भुगतान करना प्रतिबंधित किया जा सकता है
    • अगर अमेरिकी सरकार चीनी public model कंपनियों को Entity List में डाल दे, तो अमेरिका के साथ व्यापार करने वाली सभी कंपनियाँ इनके साथ लेनदेन नहीं कर पाएँगी। भले ही model के source की पूरी पहचान करना कठिन हो, सज़ा कड़ी होने के कारण अमेरिकी कंपनियाँ स्पष्ट रूप से चीनी models की आपूर्ति या उपयोग तो दूर, workaround की कोशिश भी शायद न करें
    • अगर सरकारी एजेंसियाँ Hugging Face के models की सूची बनाकर access देना प्रतिबंधित कर दें, तो वही काफी होगा। डरावनी कानूनी भाषा के बिना भी सिर्फ ban list के आधार पर अमेरिकी कंपनियाँ और hosting providers उन models को servers पर नहीं चलाएँगे
    • अमेरिकी कंपनियों को compliance के लिए मजबूर करके Hugging Face से models हटवाए जा सकते हैं, लेकिन अगर विदेश में वैकल्पिक services आ गईं, तो सब उधर चले जाएँगे। आखिरकार यह अमेरिका के लिए नुकसानदेह नतीजा होगा
    • models भी software हैं, इसलिए FedRAMP certification वाले high-assurance environments में इनके उपयोग पर रोक लगाई जा सकती है। लेकिन अमेरिका में Great Firewall नहीं है, इसलिए internet के जरिए इन्हें अंदर आने से रोकना असंभव है
  • AI industry का सबसे अजीब हिस्सा token pricing structure है। 2023 की शुरुआत में GPT-4 बहुत महँगा था, लेकिन 6 महीने बाद 20 डॉलर में काफी inference इस्तेमाल किया जा सकता था—यह क्यों हुआ, साफ नहीं है। कई labs और providers की pricing भी वर्षों तक बिना किसी स्पष्ट आधार के ऊपर-नीचे होती रही
    public-weight models कम से कम inference cost के लिए एक baseline देते हैं, pricing को अधिक तर्कसंगत बनाते हैं और predictability भी बढ़ाते हैं। Kimi K3 आने के बाद भी अगर चाहें तो K2 इस्तेमाल करते रह सकते हैं, इसलिए public models का competitive pressure और continuity users के लिए उपयोगी है

    • कीमतें उपलब्ध compute resources और competitive environment में market जितना सह सके, उसके आधार पर तय होती हैं, और यह कई price points आज़माने के बाद ही पता चलता है। providers अलग-अलग pricing plans और discounts आज़मा रहे हैं, और demand भी बदल रही है
      अगर आप स्थिर और mature market के आदी हैं तो यह उलझाऊ लग सकता है, लेकिन नए बाज़ारों में price volatility बहुत सामान्य बात है
    • जैसे GPT-5 के बाद GPT-4o को हटाने पर बड़ा विरोध हुआ था, वैसे ही हर model की अपनी खासियत होती है और कुछ use cases में पुराना model नए model से बेहतर हो सकता है। labs में LTS releases देने की इच्छा नहीं दिखती, इसलिए पुराने models को चलते रहने देने की क्षमता खास तौर पर महत्वपूर्ण है
    • FlashAttention का असर बहुत बड़ा था
    • जैसे prescription drugs महँगी होती हैं और generics सस्ती, वैसे ही यह R&D cost recovery के लिए कृत्रिम price inflation हो सकता है
    • यह भी सवाल है कि GPT-4 की कीमत वास्तव में कम की गई थी या नहीं। API के पुराने versions अब भी बहुत महँगे हैं; कीमतें सिर्फ इसलिए नीचे दिखीं क्योंकि Turbo जैसे नए models आए
      नाम में सबमें gpt-4 होने का मतलब यह नहीं कि अंदर का model एक ही है, और service cost घटाने के लिए उसमें काफी बदलाव किए गए हो सकते हैं
  • Kubernetes जैसी स्थिति तक पहुँचने के लिए शायद खुले training data वाले AI models को कई कंपनियों द्वारा मिलकर विकसित करना होगा। जैसे Linux में कंपनियाँ साथ मिलकर योगदान देती हैं, वैसे AI models business के लिए ज़रूरी हैं लेकिन उन्हें खुद बनाना बहुत महँगा है, इसलिए public models का उपयोग करना और ज़रूरी features वापस contribute करना एक तर्कसंगत तरीका हो सकता है

  • OpenAI ने भी उस समय के हिसाब से दो बेहतरीन open source models जारी किए थे। 20B model घर पर text review या Bash script draft करने के लिए शानदार है, लेकिन 120B को consumer hardware पर व्यावहारिक tokens-per-second speed के साथ चलाना मुश्किल है
    हालांकि, अच्छा होगा अगर OpenAI इन models को ज़्यादा बार अपडेट करे

    • gpt-oss-120b Strix Halo पर 30 tokens/sec से अधिक, और 128GB MacBook Pro M5 Max पर 75 tokens/sec से अधिक की रफ्तार से चलता है
      इसका आध्यात्मिक successor शायद Nemotron 3 series लगता है, लेकिन वह भी अब कुछ पुरानी हो चुकी है: https://research.nvidia.com/labs/nemotron/Nemotron-3/
      इससे नया Gemma 4 भी है: https://huggingface.co/collections/google/gemma-4
      या Qwen3.6 चुना जा सकता है: https://huggingface.co/collections/Qwen/qwen36
    • Sam Altman ने GPT-3 रिलीज़ के ढाई साल बाद एक board email में लिखा था कि अगर स्थानीय रूप से चलने वाला GPT-3-स्तर का model बनाया जाए, तो इससे दूसरे लोगों के समान-स्तर के models के release को रोका जा सकता है और नए ventures के लिए funding जुटाना कठिन बनाया जा सकता है
      चीन तकनीकी स्तर ऊपर उठाने के लिए public models जारी करता है, जबकि OpenAI और Sam उन्हें प्रतिद्वंद्वियों को दबाने के उद्देश्य से जारी करते हैं—यही फर्क है
    • OpenAI के models ठीक हैं, लेकिन रिलीज़ के समय वे Qwen3 Coder A3B जैसे alternatives की तुलना में बहुत प्रतिस्पर्धी नहीं थे। अगर आप startup हैं, तो OpenAI के पहले model की बजाय Qwen3 चुनने की बड़ी वजह है, क्योंकि उसने कई बार public-weight updates दिए जबकि OpenAI का follow-up काफी समय तक नहीं आया
      अमेरिकी labs के frontier models चाहने वाले startups के लिए मौजूदा release cadence टिकाऊ नहीं है। अगर अमेरिका यह बाज़ार पूरी तरह नहीं छोड़ना चाहता, तो OpenAI आदि को बहुत तेज़ी लानी होगी
  • जब तक चीन hardware production को बड़े पैमाने पर नहीं बढ़ाता, self-hosting आर्थिक रूप से फायदेमंद नहीं है, लेकिन यह अच्छी बात है कि open models labs पर दबाव बना रहे हैं। आखिरकार, जब mobile phones ज़्यादातर कामों के लिए पर्याप्त models चला सकेंगे, तो Apple के जीतने की संभावना बहुत अधिक है

    • Model-on-Chip आ रहा है। GPU एक general-purpose compute device है, इसलिए model inference में बड़ा bottleneck होता है, लेकिन chip पर उकेरा गया model भले बड़े पैमाने पर update न हो सके, performance gain बहुत बड़ा होता है
      इसमें cutting-edge semiconductor process भी ज़रूरी नहीं होती, इसलिए लागत काफ़ी कम की जा सकती है
    • ऐसा होने पर hyperscalers और Oracle के लिए यह लगभग अंत जैसा होगा, इसलिए उस दिन का इंतज़ार है
    • bubble से पहले की कीमतों पर 128GB Strix Halo की कीमत 1,400 डॉलर थी और यह लगभग 200W इस्तेमाल करता था, और ऐसी चार मशीनें जोड़कर 1 trillion-parameter frontier model चलाया जा सकता है: https://www.amd.com/en/developer/resources/technical-article...
      अगर प्रति node Claude Code subscription fee के 7 महीनों के हिसाब से देखें, तो 28 महीनों में शुरुआती निवेश निकल आता है, और 5 साल के depreciation आधार पर लगभग break-even लागत में दो clusters लगाए जा सकते हैं, ताकि एक साथ दो request streams संभाली जा सकें
      next-generation hardware की घोषणा पहले ही हो चुकी है, और Moore's Law के लगभग दो cycles बाद इसके आने की उम्मीद है; स्थिर कीमत 2024 value के हिसाब से 1,400 डॉलर से कम होने और performance अधिक होने की संभावना है
      जब financial bubble फूटेगा और labs data center hardware खरीदना बंद करेंगी, तब local inference subscription से सस्ता और बेहद व्यावहारिक हो जाएगा। तब देखना होगा कि UNIX Surplus dot-com crash के बाद की तरह inference servers औने-पौने दाम में बेचेगा या नहीं, या फिर power requirements घर के उपयोग के लिए बहुत खास किस्म की होंगी
    • coding के अलावा बाकी कामों के लिए quantized models को रात भर चलाना ज़्यादातर ज़रूरतें पूरी कर सकता है
    • मैं घर के desktop पर models चलाकर उन्हें phone app से इस्तेमाल करता हूँ, और model व use case के अनुसार 60~140 tokens प्रति second मिलते हैं। voice conversation बनाए रखने के लिए यह काफ़ी तेज़ है
  • सरकारों के लिए यह विचार काफ़ी मूल्यवान है कि वे किसी एक API vendor पर स्थायी रूप से निर्भर होने के बजाय portable और interoperable systems खरीदें, ताकि मांग पैदा हो। यह सिर्फ federal government ही नहीं, बल्कि California, Colorado, Illinois, New York जैसे state governments भी कर सकती हैं

  • open-weight models के साथ agentic coding की वास्तविक setup के बारे में जानने की जिज्ञासा है। कौन से execution tools और models इस्तेमाल हो रहे हैं, मासिक लागत कितनी है, और Claude Code व Pro जैसे subsidy-style pricing plans की तुलना में यह कैसा है, यह जानना चाहता हूँ
    मैं देखना चाहता हूँ कि क्या open models के सस्ते और efficient होने की बात व्यवहार में भी सही साबित होती है

    • पहले मैं custom execution tools इस्तेमाल करता था, लेकिन tools बेहतर हो गए हैं, इसलिए setup बहुत सरल हो गया है। base models भी code के कठिन हिस्सों में विफल हो जाते हैं, इसलिए मैं इन्हें केवल तब उपयोग करता हूँ जब अवसर सही हो
      Zed में मैं तीन local models इस्तेमाल करता हूँ: एक RTX 3090 पर llama.cpp में 128K context वाला Qwen 3.6 27B लगभग 50 tokens प्रति second, एक Titan V और दो GTX 1080 Ti पर llama.cpp में full-context Qwen 3.6 35B-A3B लगभग 30 tokens, और GPT-OSS 120B CPU पर धीमा चलता है
      मैं Zed के parallel agents से tasks बदलता हूँ, और जब model अटक जाता है तो उसे रोककर code ठीक करता हूँ। इस तरीके से मैं focus बनाए रखते हुए maintainable code बनाता हूँ और लक्ष्य का लगभग 80% हासिल कर लेता हूँ
      मेरे पास 30 साल का अनुभव है और मैं हमेशा समझना चाहता हूँ कि code कैसे काम करता है, इसलिए मैं code progress के लिए किसी third party पर निर्भर हुए बिना short-term लाभ का बड़ा हिस्सा ले लेता हूँ। दो GTX 5060 Ti 16GB के साथ, आम तौर पर उपलब्ध cards पर Qwen 3.6 35B-A3B में लगभग 100 tokens प्रति second संभव होना चाहिए
      नवीनतम cloud models draft tokens आदि का इस्तेमाल करके सामान्य coding में शानदार हैं, लेकिन domain-specific कामों में उनका प्रदर्शन गिर जाता है। draft model का आकार base model का सिर्फ 10~20% होता है, और top-end Blackwell GPU भी लगभग 250 tokens प्रति second तक सीमित है, इसलिए base-level performance scaling के लिए MoE या draft models चाहिए
      लेकिन मेरे use case OOD problems या training corpus में कम उदाहरण वाले problems हैं, इसलिए ऐसी optimizations मेरे लिए नुकसानदेह हैं। यह Lamborghini नहीं, बल्कि minivan की ज़रूरत वाला मामला है
    • मैं Ryzen 5950X, 128GB memory, RTX 3060 12GB पर self-hosted tools और qwen 3.6 35B unsloth 4 bit इस्तेमाल कर रहा हूँ
      10K context पर generation लगभग 40 tokens प्रति second और prefill लगभग 500 tokens मिलता है, जबकि 100K context पर generation लगभग 25 tokens और prefill लगभग 400 tokens मिलता है
      अक्सर मैं पहले GPT या Claude से detailed step-by-step plan बनवाता हूँ और फिर Qwen से उसे follow करवाता हूँ। यह आर्थिक रूप से फायदेमंद है या नहीं, इस पर मुझे पक्का यक़ीन नहीं, लेकिन hardware पहले से है और छत पर solar होने की वजह से बिजली बड़ी समस्या नहीं है
      सबसे बड़ा फ़ायदा यह है कि सारी processing पूरी तरह local होती है, और मुझे भरोसा है कि execution tools कोई uploads या telemetry नहीं करते
    • मैं Kimi K3 और OpenCode इस्तेमाल करता हूँ, और API pay-as-you-go पर लगातार उपयोग में 1~2 sessions लगभग 10 million tokens प्रति घंटा और लगभग 5 डॉलर खर्च करते हैं
      मुझे plans की सीमाएँ और उनका संचालन पसंद नहीं, इसलिए subscription plans से तुलना नहीं की है। यह Fable, Opus, Gemini से साफ़ तौर पर धीमा है, लेकिन इनके API rates की तुलना में बहुत सस्ता है
    • मैं 20 डॉलर प्रति माह वाले Ollama Cloud plan पर GLM-5.2 इस्तेमाल कर रहा हूँ। उसी plan में कई API keys लेकर उन्हें OpenWebUI server, OpenCode, और Pi development sessions में इस्तेमाल करता हूँ, और आम तौर पर 2~4 sessions एक साथ चलाने पर भी limit नहीं लगती
      काम पर Claude उपलब्ध है, और मुझे बताया गया है कि Opus का उपयोग काम के प्रति घंटे 75 डॉलर पड़ता है
    • मैंने OpenCode में GLM 5.2 awq4 इस्तेमाल किया, जो कंपनी की पसंद Sonnet 4.8 से बेहतर था और Opus 4.8 से थोड़ा कमज़ोर, लेकिन development team को ज़रूरी अधिकांश कामों के लिए पर्याप्त था। Sonnet 5 जितना अच्छा नहीं है, लेकिन tokens खत्म नहीं होते
      दूसरी ओर, इसे चलाने के लिए चार H200 चाहिए, और इस setup में context cache कर सकने वाले users केवल लगभग तीन ही हैं
      उम्मीद है कि Blackwell hardware जल्द आएगा और Kimi 3 weights सच में public होंगे। जिस बिंदु पर developers अपनी salary का बड़ा हिस्सा tokens पर खर्च करने लगते हैं, वहाँ बेहिसाब महंगे DGX servers खुद खरीदकर rack में लगाना और चलाना ही उल्टा सस्ता पड़ने लगता है
  • यह मानना कठिन है कि चीनी सरकार शीर्ष मॉडलों के प्रशिक्षण और सार्वजनिक रिलीज़ का समर्थन इसलिए कर रही है ताकि OpenAI और Anthropic पर खुली प्रतिस्पर्धा का दबाव बनाया जा सके। बल्कि यह ज़्यादा एक ऐसे साधन जैसा लगता है, जिसके जरिए अत्याधुनिक मॉडलों को चीनी सरकार द्वारा अनुमोदित सूचना-वितरण के तरीके के अनुरूप reinforcement learning कराया जाए
    अगर मुझे सवालों के जवाब देने वाली किसी अपारदर्शी प्रणाली पर भरोसा करना ही हो, तो मैं चीनी सरकार द्वारा अनुमोदित और भारी सब्सिडी पाने वाले मॉडल की बजाय बाज़ार के दबाव में काम करने वाली अमेरिकी for-profit listed company के मॉडल को चुनूंगा

    • यह उसी रणनीति से मेल खाता है जिसमें चीन दूसरे बाज़ारों में उत्पाद dumping करके प्रतिस्पर्धियों को बाहर करता है। अगर हर token पर बड़ा नुकसान हो रहा है, तो कोई शत्रुतापूर्ण पक्ष जानबूझकर उपयोग बढ़ाकर लागत भी फुला सकता है
      भौतिक dumping में मांग सीमित होती है और पर्यावरणीय लागत बड़ी होती है, लेकिन software की मांग लगभग असीमित है और उत्पादन लागत की तुलना में पर्यावरणीय लागत भी कम है, इसलिए AI dumping का उल्टा इस्तेमाल संभव हो सकता है
    • मैं जानना चाहता हूँ कि चीनी मॉडलों के राज्य-समर्थित bias से निपटने के लिए कौन से tools हैं। अगर व्यक्ति bias को आसानी से ठीक कर सकते हैं, तो यह कोई बहुत चतुर रणनीति नहीं लगती
  • यह मान लिया गया है कि चीन आगे भी frontier model weights को Hugging Face पर अपलोड करता रहेगा, मानो यह प्रकृति का नियम हो। लेकिन चीन का Mythos क्षण कुछ ही महीनों दूर है, और कई रिपोर्टों को देखें तो संभावना है कि चीन भी इसी तरह प्रतिक्रिया दे
    यह मानना कठिन है कि Mythos के बाद चीन उसका अगला संस्करण Hugging Face पर डाल देगा और सबको safety guardrails हटाने की अनुमति देगा। हालात न तो OpenAI और Anthropic की अपेक्षा के मुताबिक चले, न ही चीन की अपेक्षा के मुताबिक

    • संभव है कि वह पर्याप्त रूप से खुला रखे। इसके लिए उन मामलों को देखना चाहिए जहाँ चीन ने अफ्रीका भर में सड़कों और स्कूलों जैसी आधारभूत संरचना दी, बदले में refineries और drilling rights हासिल किए: https://oilprice.com/Energy/Crude-Oil/China-Is-Rapidly-Expan...