- पर्याप्त प्रदर्शन और portability वाले open weight models डेवलपर, cloud और enterprise के साथ मिलकर scale होने की बुनियाद बन सकते हैं, जिससे ऐसा innovation ecosystem बनता है जिसका मुकाबला किसी एक vendor के लिए करना मुश्किल है
- जैसे Kubernetes ने common interface के ऊपर networking, storage और observability tools को जोड़ा, वैसे ही AI में model serving, fine-tuning, agent runtime और evaluation तक जाने वाला production stack बढ़ रहा है
- Hugging Face पर public models की संख्या 20 लाख से आगे निकल चुकी है, GLM-5.2 ने अपनी SWE-bench Pro evaluation में 62.1% हासिल किया जो GPT-5.5 के 58.6% से आगे है, और Kimi K3 ने independent evaluation में Opus 4.8 और GPT-5.5 के समान स्कोर पाया
- अगर चीनी open weight models पर व्यापक प्रतिबंध लगाया जाता है, तो दुनिया में विकास जारी रहेगा लेकिन अमेरिकी शोधकर्ता और कंपनियां ही ecosystem से बाहर हो जाएंगी, और पिछले 1 साल में Hugging Face downloads के 41% हिस्से वाले चीनी models के आसपास innovation जमा हो सकता है
- अमेरिका को प्रतिबंध के बजाय commercial उपयोग के लिए frontier models जारी करने, portability और interoperability को महत्व देने वाली government procurement, पूरे tools और operations layer का निर्माण, और independent safety testing और standards के साथ प्रतिस्पर्धा करनी चाहिए
Kubernetes ने खुला platform की ताकत कैसे दिखाई
- Mesosphere ने Apache Mesos पर आधारित open source cloud-native software विकसित किया और उसके आसपास DC/OS बनाकर support और proprietary features वाले enterprise distribution के रूप में commercialize किया
- बाद में इससे नया और अधिक पूर्ण open source project Kubernetes आया, जिसने cloud-native community को एकजुट किया और Mesosphere को हिला दिया
- दुनिया भर के distributed systems और infrastructure engineers ने Kubernetes पर अपना करियर दांव पर लगाया, और Mesosphere community के कुछ वफादार सदस्य भी उधर चले गए
- innovation का केंद्र Kubernetes की ओर शिफ्ट होते ही networking, storage, observability, deployment tools और policy engines जैसे पहले से कमज़ोर हिस्से तेजी से विकसित हुए
- कई startups और मौजूदा vendors के जुड़ने से Kubernetes को production में चलाने के लिए ज़रूरी लगभग हर component open source के रूप में उपलब्ध हो गया
- cloud providers, Mesosphere/D2iQ, Rancher, Red Hat और Nutanix ने integration, enterprise features, support और operations के आसपास business बनाया
- Kubernetes की सफलता सिर्फ repository public कर देने का नतीजा नहीं थी
- यह engineers, cloud providers और enterprise vendors के लिए ग्राहक ज़रूरतों के हिसाब से विस्तार करने योग्य neutral foundation बन गया
- common interfaces और vendor-neutral governance ने प्रतिभागियों को यह भरोसा दिया कि वे लंबे समय के लिए products बना सकते हैं
- जब customizable open platform किसी industry का केंद्र बन जाता है, तो किसी एक vendor के लिए पूरे ecosystem की combined innovation speed का पीछा करना मुश्किल हो जाता है
Open weight और open source AI में अंतर
- जिन्हें अक्सर open source कहा जाता है, ऐसे ज़्यादातर models वास्तव में open weight models हैं
- इनके trained parameters डाउनलोड और modify किए जा सकते हैं, लेकिन training data और पूरी training process आमतौर पर public नहीं होती
- इसलिए ये Open Source Initiative की open source AI definition पर खरे नहीं उतरते
- पूरी तरह open source न होने पर भी, ऐसे outputs के आसपास ecosystem बन सकता है जिन्हें user चला और modify कर सके
- Kubernetes और AI की संरचना में महत्वपूर्ण अंतर भी हैं
- Kubernetes contributors असली source code की जांच और बदलाव कर सकते थे, और improvements को shared upstream project में वापस भेज सकते थे
- model fine-tuning के नतीजे आमतौर पर उसी तरह साझा नहीं किए जाते
- frontier model के weights डाउनलोड किए जा सकें, तब भी उन्हें चलाने के लिए महंगा hardware चाहिए हो सकता है
- AI में CNCF जैसी कोई संस्था नहीं है जो neutral governance और common interfaces दे
- दोनों ecosystems की समानता यह है कि पर्याप्त प्रदर्शन और portability वाली बुनियाद, मूल निर्माता की अकेले बनाने की क्षमता से आगे बढ़कर complementary innovation को आकर्षित करती है
Self-hosting से model platform तक
- open weight models अपनाने की पहली वजह self-hosting थी
- enterprises अपनी data पर सीधा नियंत्रण रखते हुए अपने cloud या data center में models चलाना चाहते थे
- usage और inference cost बढ़ने के साथ cost को सीधे नियंत्रित करने की मांग भी बढ़ी
- इसी मांग के आधार पर vLLM, SGLang, llama.cpp, Ollama और MLX जैसे open source model serving stacks बने
- open weight, self-hosting से आगे बढ़कर डेवलपर्स को खुद model modify और redistribute करने देता है
- Hugging Face पर 20 लाख से अधिक public models registered हैं
- Qwen और Gemma जैसी लोकप्रिय model families के आसपास कई तरह के derived outputs बन रहे हैं
- अलग-अलग semiconductor architectures और scales के लिए quantized और converted weights
- coding, medicine, law, math और agent workflows के लिए fine-tuned models और LoRA adapters
- अलग-अलग fine-tuning results को मिलाकर model merging
- TensorRT-LLM, vLLM, MLX जैसे अलग-अलग runtimes के लिए model variants
Frontier और घटता performance gap
- पहले open models का base performance सबसे कठिन coding और agent tasks के लिए कमज़ोर था, इसलिए उन्हें frontier race से बाहर मानना आसान था, लेकिन यह gap तेजी से घट रहा है
- Z.ai ने MIT license के तहत open weights वाला GLM-5.2 जारी किया
- इसकी अपनी evaluation में SWE-bench Pro score 62.1% रहा, जो GPT-5.5 के 58.6% से अधिक है
- हालांकि results benchmark और agent harness के हिसाब से बदल सकते हैं
- Moonshot ने कहा कि Kimi K3 लंबी coding tasks में closed frontier models के करीब पहुंचता है, और 27 जुलाई को weights जारी करने का वादा किया
- Artificial Analysis की independent evaluation में भी Kimi K3 को Opus 4.8 और GPT-5.5 के समान स्कोर मिले
- जब base models का प्रदर्शन पर्याप्त हो जाता है, तो agent runtimes, coding harnesses, sandboxes, evaluation, observability और specialized fine-tuning projects श्रृंखलाबद्ध तरीके से बढ़ सकते हैं
- ये components मिलकर ऐसा production-grade open stack बनाते हैं जिसे टीम के workload, hardware और cost structure के हिसाब से adjust किया जा सकता है
- इसमें open weight models, open source software के ऊपर चलाए जाते हैं
- यह गारंटी नहीं देता कि हर benchmark में हर closed model को हरा देगा
- frontier AI, talent competition है, और open ecosystem दुनिया भर की प्रतिभा को एक ही foundation पर build करने की वजह देता है
चीनी models पर प्रतिबंध का अमेरिका पर असर
- Kimi K3 जैसे शक्तिशाली चीनी models के आने के बाद, बताया गया है कि Trump administration चीनी open weight models पर पाबंदियों पर विचार कर रहा है
- संभावित प्रतिबंध किस रूप में होगा, यह अभी स्पष्ट नहीं है
- अगर चीनी open weight models के उपयोग पर व्यापक रोक लगती है, तो अमेरिकी शोधकर्ता और कंपनियां खुद को उस ecosystem से अलग कर सकती हैं जहां दुनिया के AI researchers और engineers जुट रहे हैं
- इस ecosystem में कई चीनी शोधकर्ता भी शामिल हैं
- दुनिया भर में development जारी रहेगा, लेकिन अमेरिकी डेवलपर्स ही उससे वंचित रहेंगे
- Qwen के आसपास यही रुझान पहले से दिख रहा है
- Hugging Face के अनुसार पिछले 1 साल में चीनी models का हिस्सा कुल model downloads का 41% रहा
- अगर सबसे बेहतर open weight base models चीन से आते रहे, तो Kubernetes की तरह उन्हीं models के आसपास tools और innovation जमा हो सकते हैं
अमेरिका चार तरीकों से कैसे प्रतिस्पर्धा कर सकता है
-
Frontier-स्तर के अमेरिकी models जारी करना
- अमेरिकी labs को ऐसे license के साथ frontier-grade open weight models जारी करने चाहिए जिन पर startups वास्तविक products बना सकें
- कुछ प्रगति पहले से दिख रही है
- NVIDIA Nemotron को NVIDIA के permissive license के तहत commercial उपयोग के लिए उपलब्ध कराया गया है
- Thinking Machines का Inkling, OpenAI का gpt-oss, और Google का Gemma 4 Apache 2.0 के तहत जारी किए गए हैं
- लेकिन OpenAI और Google के सर्वोच्च प्रदर्शन वाले models सहित अमेरिका की ज़्यादातर frontier labs के सबसे ताकतवर models अब भी closed हैं
-
Government procurement से open market बनाना
- government procurement को ऐसे systems की मांग बनानी चाहिए जिनमें portability और interoperability हो, न कि ऐसे systems की जो हमेशा के लिए एक API vendor पर निर्भर हों
- अमेरिकी रक्षा विभाग पहले से ऐसा ही approach इस्तेमाल करता है
- Platform One open source tools और enterprise products देता है जिन पर कई military programs build कर सकते हैं
- इसी procurement approach से open weight models के आसपास innovation तेज किया जा सकता है
-
Models से परे पूरा stack बनाना
- अमेरिकी कंपनियों को models के आसपास की बाकी layers भी बनानी होंगी
- startups models को customize, scale और products में embed कर सकते हैं
- serving, tools, support और operations layers भी business opportunity हैं
- अमेरिका की प्रमुख semiconductor कंपनियां hardware को लगातार बेहतर बना सकती हैं, और hyperscalers व neoclouds models और ecosystem को service के रूप में दे सकते हैं
-
प्रतिबंध के बजाय testing और standards लाना
- safety, restrictions के समर्थन का सबसे मजबूत तर्क है, लेकिन पूर्ण प्रतिबंध बहुत व्यापक है और पूरे ecosystem तक पहुंच की कीमत पर आता है
- बेहतर जवाब यह होगा कि frontier models के लिए independent testing और standards तैयार किए जाएं
- Kubernetes conformance testing safety नहीं बल्कि compatibility को verify करती है, इसलिए यह AI के लिए पूरी तरह समान उदाहरण नहीं है
- फिर भी independent criteria और governance model से सीख ली जा सकती है
- Demis Hassabis ने इसी तरह की अमेरिका-नेतृत्व वाली independent standards body का प्रस्ताव दिया है
Open AI ecosystem में प्रतिस्पर्धा की रणनीति
- अमेरिका को अपने डेवलपर्स के आसपास दीवारें खड़ी करने के बजाय चीनी models को सीधे चलाना, उनके अंदरूनी हिस्सों का विश्लेषण करना, benchmark करना और उन्हें बेहतर बनाना चाहिए
- साथ ही उसे बेहतर अमेरिकी विकल्प बनाने चाहिए ताकि अमेरिकी AI stack दुनिया में अपनाने के लिए सबसे आसान विकल्प बन सके
- अमेरिका दशकों से दुनिया की सर्वश्रेष्ठ tech talent को आकर्षित और विकसित करने की जगह देता आया है
- अगर दूसरे देश अधिक खुले stacks को standard के रूप में अपनाते रहें और अमेरिका अपनी इस बढ़त को closed ecosystem में बदल दे, तो वह AI leader की अपनी स्थिति खुद छोड़ देगा
1 टिप्पणियां
Hacker News की राय
चीनी मॉडल पर प्रतिबंध तकनीकी रूप से असंभव लगता है। weights आखिर सिर्फ numbers हैं, इसलिए अमेरिकी और चीनी weights में फर्क नहीं किया जा सकता, और source-आधारित प्रतिबंध को आसानी से bypass किया जा सकता है
आखिरकार सभी public-weight models को regulate करना पड़ेगा, और Axios की रिपोर्ट के अनुसार प्रमुख AI labs या संबंधित लोगों ने हर 3~5 महीने में प्रशासन को open source models पर प्रतिबंध का प्रस्ताव भी दिया है
DRM जैसी license व्यवस्था लागू करके सिर्फ प्रमाणित अमेरिकी models को अपने servers पर चलाने की अनुमति दी जा सकती है, लेकिन इससे बड़े labs को monopoly मिल जाएगी और derived models के वितरण पर भी रोक लगेगी। विदेशों में इसे लागू करना मुश्किल होगा, इसलिए आखिर में संभव है कि सिर्फ अमेरिकी नागरिक ही सीमित रह जाएँ
इसके बजाय चीनी कंपनियों या चीनी स्वामित्व वाली कंपनियों को inference/AI services के लिए भुगतान करना प्रतिबंधित किया जा सकता है
AI industry का सबसे अजीब हिस्सा token pricing structure है। 2023 की शुरुआत में GPT-4 बहुत महँगा था, लेकिन 6 महीने बाद 20 डॉलर में काफी inference इस्तेमाल किया जा सकता था—यह क्यों हुआ, साफ नहीं है। कई labs और providers की pricing भी वर्षों तक बिना किसी स्पष्ट आधार के ऊपर-नीचे होती रही
public-weight models कम से कम inference cost के लिए एक baseline देते हैं, pricing को अधिक तर्कसंगत बनाते हैं और predictability भी बढ़ाते हैं। Kimi K3 आने के बाद भी अगर चाहें तो K2 इस्तेमाल करते रह सकते हैं, इसलिए public models का competitive pressure और continuity users के लिए उपयोगी है
अगर आप स्थिर और mature market के आदी हैं तो यह उलझाऊ लग सकता है, लेकिन नए बाज़ारों में price volatility बहुत सामान्य बात है
नाम में सबमें
gpt-4होने का मतलब यह नहीं कि अंदर का model एक ही है, और service cost घटाने के लिए उसमें काफी बदलाव किए गए हो सकते हैंKubernetes जैसी स्थिति तक पहुँचने के लिए शायद खुले training data वाले AI models को कई कंपनियों द्वारा मिलकर विकसित करना होगा। जैसे Linux में कंपनियाँ साथ मिलकर योगदान देती हैं, वैसे AI models business के लिए ज़रूरी हैं लेकिन उन्हें खुद बनाना बहुत महँगा है, इसलिए public models का उपयोग करना और ज़रूरी features वापस contribute करना एक तर्कसंगत तरीका हो सकता है
OpenAI ने भी उस समय के हिसाब से दो बेहतरीन open source models जारी किए थे। 20B model घर पर text review या Bash script draft करने के लिए शानदार है, लेकिन 120B को consumer hardware पर व्यावहारिक tokens-per-second speed के साथ चलाना मुश्किल है
हालांकि, अच्छा होगा अगर OpenAI इन models को ज़्यादा बार अपडेट करे
gpt-oss-120bStrix Halo पर 30 tokens/sec से अधिक, और 128GB MacBook Pro M5 Max पर 75 tokens/sec से अधिक की रफ्तार से चलता हैइसका आध्यात्मिक successor शायद Nemotron 3 series लगता है, लेकिन वह भी अब कुछ पुरानी हो चुकी है: https://research.nvidia.com/labs/nemotron/Nemotron-3/
इससे नया Gemma 4 भी है: https://huggingface.co/collections/google/gemma-4
या Qwen3.6 चुना जा सकता है: https://huggingface.co/collections/Qwen/qwen36
चीन तकनीकी स्तर ऊपर उठाने के लिए public models जारी करता है, जबकि OpenAI और Sam उन्हें प्रतिद्वंद्वियों को दबाने के उद्देश्य से जारी करते हैं—यही फर्क है
अमेरिकी labs के frontier models चाहने वाले startups के लिए मौजूदा release cadence टिकाऊ नहीं है। अगर अमेरिका यह बाज़ार पूरी तरह नहीं छोड़ना चाहता, तो OpenAI आदि को बहुत तेज़ी लानी होगी
जब तक चीन hardware production को बड़े पैमाने पर नहीं बढ़ाता, self-hosting आर्थिक रूप से फायदेमंद नहीं है, लेकिन यह अच्छी बात है कि open models labs पर दबाव बना रहे हैं। आखिरकार, जब mobile phones ज़्यादातर कामों के लिए पर्याप्त models चला सकेंगे, तो Apple के जीतने की संभावना बहुत अधिक है
इसमें cutting-edge semiconductor process भी ज़रूरी नहीं होती, इसलिए लागत काफ़ी कम की जा सकती है
अगर प्रति node Claude Code subscription fee के 7 महीनों के हिसाब से देखें, तो 28 महीनों में शुरुआती निवेश निकल आता है, और 5 साल के depreciation आधार पर लगभग break-even लागत में दो clusters लगाए जा सकते हैं, ताकि एक साथ दो request streams संभाली जा सकें
next-generation hardware की घोषणा पहले ही हो चुकी है, और Moore's Law के लगभग दो cycles बाद इसके आने की उम्मीद है; स्थिर कीमत 2024 value के हिसाब से 1,400 डॉलर से कम होने और performance अधिक होने की संभावना है
जब financial bubble फूटेगा और labs data center hardware खरीदना बंद करेंगी, तब local inference subscription से सस्ता और बेहद व्यावहारिक हो जाएगा। तब देखना होगा कि UNIX Surplus dot-com crash के बाद की तरह inference servers औने-पौने दाम में बेचेगा या नहीं, या फिर power requirements घर के उपयोग के लिए बहुत खास किस्म की होंगी
सरकारों के लिए यह विचार काफ़ी मूल्यवान है कि वे किसी एक API vendor पर स्थायी रूप से निर्भर होने के बजाय portable और interoperable systems खरीदें, ताकि मांग पैदा हो। यह सिर्फ federal government ही नहीं, बल्कि California, Colorado, Illinois, New York जैसे state governments भी कर सकती हैं
open-weight models के साथ agentic coding की वास्तविक setup के बारे में जानने की जिज्ञासा है। कौन से execution tools और models इस्तेमाल हो रहे हैं, मासिक लागत कितनी है, और Claude Code व Pro जैसे subsidy-style pricing plans की तुलना में यह कैसा है, यह जानना चाहता हूँ
मैं देखना चाहता हूँ कि क्या open models के सस्ते और efficient होने की बात व्यवहार में भी सही साबित होती है
Zed में मैं तीन local models इस्तेमाल करता हूँ: एक RTX 3090 पर
llama.cppमें 128K context वाला Qwen 3.6 27B लगभग 50 tokens प्रति second, एक Titan V और दो GTX 1080 Ti परllama.cppमें full-context Qwen 3.6 35B-A3B लगभग 30 tokens, और GPT-OSS 120B CPU पर धीमा चलता हैमैं Zed के parallel agents से tasks बदलता हूँ, और जब model अटक जाता है तो उसे रोककर code ठीक करता हूँ। इस तरीके से मैं focus बनाए रखते हुए maintainable code बनाता हूँ और लक्ष्य का लगभग 80% हासिल कर लेता हूँ
मेरे पास 30 साल का अनुभव है और मैं हमेशा समझना चाहता हूँ कि code कैसे काम करता है, इसलिए मैं code progress के लिए किसी third party पर निर्भर हुए बिना short-term लाभ का बड़ा हिस्सा ले लेता हूँ। दो GTX 5060 Ti 16GB के साथ, आम तौर पर उपलब्ध cards पर Qwen 3.6 35B-A3B में लगभग 100 tokens प्रति second संभव होना चाहिए
नवीनतम cloud models draft tokens आदि का इस्तेमाल करके सामान्य coding में शानदार हैं, लेकिन domain-specific कामों में उनका प्रदर्शन गिर जाता है। draft model का आकार base model का सिर्फ 10~20% होता है, और top-end Blackwell GPU भी लगभग 250 tokens प्रति second तक सीमित है, इसलिए base-level performance scaling के लिए MoE या draft models चाहिए
लेकिन मेरे use case OOD problems या training corpus में कम उदाहरण वाले problems हैं, इसलिए ऐसी optimizations मेरे लिए नुकसानदेह हैं। यह Lamborghini नहीं, बल्कि minivan की ज़रूरत वाला मामला है
qwen 3.6 35B unsloth 4 bitइस्तेमाल कर रहा हूँ10K context पर generation लगभग 40 tokens प्रति second और prefill लगभग 500 tokens मिलता है, जबकि 100K context पर generation लगभग 25 tokens और prefill लगभग 400 tokens मिलता है
अक्सर मैं पहले GPT या Claude से detailed step-by-step plan बनवाता हूँ और फिर Qwen से उसे follow करवाता हूँ। यह आर्थिक रूप से फायदेमंद है या नहीं, इस पर मुझे पक्का यक़ीन नहीं, लेकिन hardware पहले से है और छत पर solar होने की वजह से बिजली बड़ी समस्या नहीं है
सबसे बड़ा फ़ायदा यह है कि सारी processing पूरी तरह local होती है, और मुझे भरोसा है कि execution tools कोई uploads या telemetry नहीं करते
मुझे plans की सीमाएँ और उनका संचालन पसंद नहीं, इसलिए subscription plans से तुलना नहीं की है। यह Fable, Opus, Gemini से साफ़ तौर पर धीमा है, लेकिन इनके API rates की तुलना में बहुत सस्ता है
काम पर Claude उपलब्ध है, और मुझे बताया गया है कि Opus का उपयोग काम के प्रति घंटे 75 डॉलर पड़ता है
GLM 5.2 awq4इस्तेमाल किया, जो कंपनी की पसंद Sonnet 4.8 से बेहतर था और Opus 4.8 से थोड़ा कमज़ोर, लेकिन development team को ज़रूरी अधिकांश कामों के लिए पर्याप्त था। Sonnet 5 जितना अच्छा नहीं है, लेकिन tokens खत्म नहीं होतेदूसरी ओर, इसे चलाने के लिए चार H200 चाहिए, और इस setup में context cache कर सकने वाले users केवल लगभग तीन ही हैं
उम्मीद है कि Blackwell hardware जल्द आएगा और Kimi 3 weights सच में public होंगे। जिस बिंदु पर developers अपनी salary का बड़ा हिस्सा tokens पर खर्च करने लगते हैं, वहाँ बेहिसाब महंगे DGX servers खुद खरीदकर rack में लगाना और चलाना ही उल्टा सस्ता पड़ने लगता है
यह मानना कठिन है कि चीनी सरकार शीर्ष मॉडलों के प्रशिक्षण और सार्वजनिक रिलीज़ का समर्थन इसलिए कर रही है ताकि OpenAI और Anthropic पर खुली प्रतिस्पर्धा का दबाव बनाया जा सके। बल्कि यह ज़्यादा एक ऐसे साधन जैसा लगता है, जिसके जरिए अत्याधुनिक मॉडलों को चीनी सरकार द्वारा अनुमोदित सूचना-वितरण के तरीके के अनुरूप reinforcement learning कराया जाए
अगर मुझे सवालों के जवाब देने वाली किसी अपारदर्शी प्रणाली पर भरोसा करना ही हो, तो मैं चीनी सरकार द्वारा अनुमोदित और भारी सब्सिडी पाने वाले मॉडल की बजाय बाज़ार के दबाव में काम करने वाली अमेरिकी for-profit listed company के मॉडल को चुनूंगा
भौतिक dumping में मांग सीमित होती है और पर्यावरणीय लागत बड़ी होती है, लेकिन software की मांग लगभग असीमित है और उत्पादन लागत की तुलना में पर्यावरणीय लागत भी कम है, इसलिए AI dumping का उल्टा इस्तेमाल संभव हो सकता है
यह मान लिया गया है कि चीन आगे भी frontier model weights को Hugging Face पर अपलोड करता रहेगा, मानो यह प्रकृति का नियम हो। लेकिन चीन का Mythos क्षण कुछ ही महीनों दूर है, और कई रिपोर्टों को देखें तो संभावना है कि चीन भी इसी तरह प्रतिक्रिया दे
यह मानना कठिन है कि Mythos के बाद चीन उसका अगला संस्करण Hugging Face पर डाल देगा और सबको safety guardrails हटाने की अनुमति देगा। हालात न तो OpenAI और Anthropic की अपेक्षा के मुताबिक चले, न ही चीन की अपेक्षा के मुताबिक