- चीन का open-weight मॉडल Kimi K3 अत्याधुनिक मॉडलों के करीब पहुंच गया है, लेकिन AI बिज़नेस की प्रतिस्पर्धात्मकता मॉडल डेवलपमेंट लागत से ज़्यादा उस cost of goods sold (COGS) पर तय होती है जो सही जवाब के स्तर की intelligence देती है
- हर मॉडल को सही जवाब तक पहुंचने के लिए अलग-अलग मात्रा में tokens चाहिए होते हैं, इसलिए token खुद कोई interchangeable commodity नहीं हैं; असल में commodity बन रही चीज़ token से बनाई गई intelligence है
- Anthropic और OpenAI की ऊंची कीमतें काफी हद तक computing supply की कमी से आती हैं, और भले ही चीनी मॉडल प्रति token सस्ते हों, अगर वे ज्यादा inference tokens इस्तेमाल करें तो cost advantage गायब हो सकता है
- चीन open-weight मॉडलों के जरिए AI को commodity बनाकर अपने robotics और physical industry को मजबूत करना चाहता है, और distillation के जरिए अमेरिकी अत्याधुनिक मॉडलों को कम-लागत वाले teacher की तरह इस्तेमाल करने का संरचनात्मक लाभ भी लेता है
- अगर अमेरिका cyber security के लिए अत्याधुनिक मॉडलों पर लगी पाबंदियां ढीली नहीं करता और अपने open-weight डेवलपर्स को distillation की अनुमति नहीं देता, तो अमेरिकी कंपनियों को रक्षा के लिए चीनी मॉडलों पर निर्भर होना पड़ेगा
सॉफ़्टवेयर से अलग हुई AI की cost structure
- सॉफ़्टवेयर में marginal cost और transaction cost लगभग 0 के करीब होने से मांग पर कब्ज़ा करने वाली कंपनियों को centralization और scale का फायदा मिलता था, लेकिन AI में marginal cost फिर से industry structure तय कर रही है
- open-weight मॉडल weights बनाने की R&D लागत बचाते हैं, लेकिन service cost को मुफ्त नहीं बनाते
- R&D लागत revenue से असंबंधित fixed cost है
- inference cost उपयोग और revenue बढ़ने के साथ बढ़ने वाली cost of goods sold है
- अगर token generation cost revenue के हर 1 डॉलर पर 0.50 डॉलर है, तो 100 million डॉलर revenue पर 50 million डॉलर COGS होगा, और 100 thousand डॉलर revenue पर 50 thousand डॉलर
- Kimi K3 की कीमत input के लिए 1 million tokens पर 3 डॉलर और output के लिए 1 million tokens पर 15 डॉलर है, जबकि Sol की कीमतें क्रमशः 5 डॉलर और 30 डॉलर हैं
- लेकिन केवल token unit price से किसी मॉडल द्वारा वास्तविक intelligence देने की कुल लागत समझना मुश्किल है
commodity token नहीं, intelligence बन रही है
- अगर Nvidia GPU को मॉडल-स्वतंत्र 'token factory' के रूप में परिभाषित करे, तो tokens per second, time to first token, tokens per watt और token cost प्रमुख metrics बनते हैं
- ChatGPT युग में, जब tokens सीधे users तक पहुंचाए जाते थे, यह measurement ठीक बैठता था; लेकिन reasoning युग में chain-of-thought tokens बहुत बढ़ जाते हैं और हर मॉडल को सही जवाब के लिए अलग संख्या में tokens चाहिए होते हैं
- माना जाता है कि Kimi, Sol की तुलना में बहुत ज्यादा tokens इस्तेमाल करता है, इसलिए listed price का फायदा खत्म हो सकता है
- agent workflow में भी अलग-अलग मॉडलों को काम पूरा करने के लिए अलग token count चाहिए होता है
- tokens interchangeable नहीं हैं, इसलिए वे crude oil, copper या wheat जैसी commodities नहीं हैं
- अगर कई मॉडल एक ही सही जवाब बना सकते हैं, तो commodity token नहीं बल्कि सही जवाब के स्तर की intelligence है, और उस जवाब तक पहुंचने में खर्च हुए tokens की संख्या COGS का अंतर बनाती है
- intelligence का COGS पांच तत्वों से तय होता है
- model size: weights और runtime state यह तय करते हैं कि serving replica के लिए कितनी महंगी memory और कितने accelerators चाहिए
- inference efficiency: Mixture-of-Experts जैसी architecture generated token प्रति computation कम करती है
- memory efficiency: KV cache की जरूरत घटाने से concurrent requests और GPU utilization बढ़ सकते हैं
- serving efficiency: batching, scheduling, prefix caching आदि requests के बीच काम साझा करके utilization बढ़ाते हैं
- token efficiency: सही जवाब के लिए जितने कम tokens चाहिए, inference cost उतनी कम होती है
- एक बेसिक CRUD app पहले से कई providers के मॉडलों से बनाई जा सकती है, इसलिए ऐसे कामों में ऊंची कीमत नहीं बल्कि बेहतर cost structure profitability तय करती है
commodity बाज़ार की price और profit structure
- commodity बाज़ार में सभी suppliers एक ही चीज़ बेचते हैं, इसलिए कीमत demand और supply से तय होती है
- कीमत घटने पर demand बढ़ाने वाली price elasticity काम करती है
- supply volume commodity बनाने की marginal cost पर निर्भर करता है
- हर supplier की marginal cost अलग होने से सबसे महंगे marginal supplier की लागत market price तय करती है, और बाकी suppliers का profit इस बात पर निर्भर करता है कि वे उससे कितना सस्ता उत्पादन करते हैं
- अगर supplier A, B, C क्रमशः 10, 15, 20 डॉलर प्रति unit पर 10-10 units बनाते हैं, और 20 डॉलर की कीमत पर demand 25 units है, तो स्थिति ऐसी होगी
- A, 10 units बेचकर प्रति unit 10 डॉलर कमाता है
- B, 10 units बेचकर प्रति unit 5 डॉलर बचाता है
- C, 5 units बेचता है लेकिन प्रति unit कोई profit नहीं कमाता
- व्यवहार में A और B, C से थोड़ा कम दाम रख सकते हैं और price change demand को भी प्रभावित करेगा, लेकिन सबसे महंगे supplier के दिवालिया होने का जोखिम उठाने वाली संरचना वही रहती है
- market-clearing price में R&D लागत या equipment procurement debt जैसी fixed cost शामिल नहीं की जा सकती, लेकिन ये लागतें कम-लाभ वाले suppliers को बाहर कर सकती हैं
- suppliers के बाहर होने पर, जब तक दूसरे suppliers प्रवेश न करें या मौजूदा suppliers capacity न बढ़ाएं, कीमतें बढ़ती हैं
मौजूदा intelligence बाज़ार में चीनी मॉडलों की स्थिति
- अभी अत्याधुनिक मॉडल बाज़ार में computing shortage के कारण demand supply से अधिक है, इसलिए यह पूरी तरह commodity market की शर्तें पूरी नहीं करता
- Nvidia ऊंचे margin पर computing देता है, और SpaceXAI जैसे ग्राहक इसे Anthropic को फिर ऊंचे margin पर resell भी करते हैं, इसलिए Anthropic tokens पर और ऊंची कीमत लगा सकता है
- संभव है कि Anthropic और OpenAI model performance, serving scale और token efficiency की वजह से अत्याधुनिक गुणवत्ता वाली intelligence की unit cost के लिहाज़ से सबसे कम-लागत वाले समूह हों
- वे competitors से कई महीने पहले किसी खास performance level तक पहुंचते हैं
- वे अपने सबसे अच्छे मॉडलों का उपयोग फिर cost optimization के लिए करते हैं
- बाज़ार की demand अभी abstract intelligence की बजाय सीधे Anthropic और OpenAI की ओर जाती है, और अपेक्षाकृत कमज़ोर SpaceXAI और Meta, Anthropic को capacity बेचते हैं
- अगर काम को जरूरी intelligence level के रूप में परिभाषित किया जाए, तो खरीदार supplier बदल सकने वाला commodity market बनाया जा सकता है
- लंबी अवधि में अत्याधुनिक मॉडल कुछ महीनों बाद non-frontier market में नीचे आ जाते हैं, और इस दौरान डेवलपर्स serving cost optimize कर सकते हैं, इसलिए frontier कंपनियों को निचले बाज़ारों में भी बढ़त मिलती है
- चीनी मॉडलों की कम listed price, Anthropic और OpenAI की उन ऊंची कीमतों से तुलना का नतीजा हो सकती है जो supply shortage की वजह से तय हुई हैं
- इस बात के पर्याप्त प्रमाण नहीं हैं कि Kimi marginal cost के हिसाब से सच में सस्ता है, और token efficiency को जोड़ने पर चीनी मॉडलों पर आर्थिक प्रतिक्रिया बढ़ा-चढ़ाकर हो सकती है
frontier labs चीनी मॉडलों से क्यों सतर्क हैं
- frontier labs उस दौर की financial structure से बंधे हुए हैं जब training, inference की तुलना में ज्यादा GPU खाती थी
- अगली training को support करने के लिए उन्हें inference revenue maximize करना पड़ता था, और इसके लिए ऊंची inference pricing चाहिए थी
- आगे training cost लगातार बढ़े तब भी inference market उससे तेज़ी से बढ़ने की उम्मीद है
- agent paradigm ने बड़े पैमाने की demand खोल दी है, इसलिए पर्याप्त computing मिलने पर कम कीमत और ज्यादा usage के साथ growth संभव है
- intelligence कोई perfect commodity नहीं है; वास्तविक उपयोग के दौरान जुटा data अगला मॉडल और स्मार्ट बनाता है
- computing supply बढ़ने पर कीमत घटाकर usage और data दोनों बढ़ाने की incentive पैदा होती है
- Microsoft की enterprise self-hosted model execution support पर केंद्रित strategy भी तब ज्यादा viable होती है जब चीनी मॉडल एक वास्तविक alternative की तरह काम करें
- frontier labs customer experience तक फैलकर चीनी मॉडलों और दूसरी labs से खुद को अलग कर सकते हैं
- Claude Code और Codex में users जिस harness को पहले चुनते हैं, उसमें टिके रहने की मजबूत persistence दिखती है
- यह persistence non-technical users में और अधिक मजबूत हो सकती है
- labs का upper layer में प्रवेश, Microsoft समेत software vendors के लिए खतरा बनता है
- जिन software कंपनियों ने पहले से customer experience पर कब्ज़ा किया है, वे competitive मॉडलों तक बेहतर पहुंच होने पर labs की घुसपैठ का अधिक आसानी से विरोध कर सकती हैं
- Anthropic का रुख है कि शक्तिशाली AI को संभालने के लिए केवल उसी पर भरोसा किया जा सकता है, और open-weight alternatives यह आधार ही तोड़ देते हैं
चीन की open-weight strategy
- Alibaba के Qwen3.8 Max में 2.4 trillion parameters हैं, और कंपनी इसे Anthropic की Fable 5 के बाद दूसरे स्तर का बताती है
- Moonshot AI के Kimi K3 में 2.8 trillion parameters हैं
- Qwen3.8 Max, Qoder सहित Alibaba के coding platform पर उपलब्ध है
- Alibaba preview के बाद weights जारी करने की योजना बना रही है
- चीनी मॉडलों की मांग बढ़ने पर Moonshot ने नए subscriptions लेना अस्थायी रूप से रोक दिया
- Alibaba ने पहले frontier model weights जारी करना बंद किया था, लेकिन अब फिर open-weight पर लौट आई है
- Xi Jinping के AI भाषण में open source, openness, cooperation और sharing को प्रोत्साहित किया गया, और इस बात पर ज़ोर दिया गया कि AI digital world से physical world की ओर बढ़ रहा है
- इसमें कहा गया कि AI का उपयोग traditional industries के transformation, emerging industries की growth और future industries की planning में हो ताकि सभी industries और enterprises लाभ उठा सकें
- चीन की strategy अपने घरेलू उद्योगों को complement करने वाले AI को commodity बनाना है
- जिन क्षेत्रों में चीन मजबूत है, जैसे physical world और robotics, वे व्यापक रूप से उपलब्ध AI मॉडलों से लाभ उठा सकते हैं
- इससे अमेरिका को AI में asymmetric advantage पाने से रोका जा सकता है और अमेरिकी frontier labs की ताकत कम की जा सकती है
- साथ ही open ecosystem से पैदा होने वाले innovation को भी absorb किया जा सकता है
distillation से बनता संरचनात्मक अंतर
- यह संभावना कम है कि चीन frontier labs के खिलाफ distillation attack रोकने वाला है
- चीन की labs की पूरी सफलता को distillation पर थोपना भी गलत है, और distillation के बड़े लाभ से इनकार करना भी गलत है
- पिछले एक साल में post-training reinforcement learning मॉडल performance के लिए ज्यादा महत्वपूर्ण हुई है, इसलिए distillation का असर बढ़ा है
- चीनी labs को reinforcement learning environment शुरू से नहीं बनाना पड़ता; वे frontier models को teacher की तरह इस्तेमाल कर सकती हैं
- इससे वे बहुत कम लागत पर तेजी से सुधार करती हैं
- distillation, चीनी मॉडलों की कम development cost समझाने वाला एकमात्र कारण नहीं है, लेकिन यह महत्वपूर्ण कारण है
- पश्चिम में भी चीनी मॉडल खुद distillation के लिए इस्तेमाल हो रहे हैं
- open-weight मॉडल जारी करने वाली Thinking Machines, reinforcement learning की cold start problem हल करने के लिए चीनी मॉडलों पर निर्भर है
- Dean Meyer और Konstantine Buhler के analysis के अनुसार चीनी labs के पास बेहतरीन researchers, large-scale computing, मजबूत pre-training models, software-hardware co-design और बेहतर post-training capabilities हैं
- distillation, मजबूत base model और frontier-निकट system के बीच की महंगी आखिरी दूरी को compress कर देता है
- enforcement बड़े पैमाने की distillation को कठिन और महंगा बना सकता है, लेकिन state-backed actors की distillation को खत्म नहीं कर सकता
- पश्चिमी frontier models जितने आगे बढ़ते हैं, चीनी labs को उतने नए teachers मिलते जाते हैं
- अमेरिकी open-weight डेवलपर्स को frontier labs की terms of service माननी पड़ती हैं, इसलिए वे चीनी मॉडलों की तुलना में नुकसान में हैं, और अंततः उन्हें चीनी मॉडलों के जरिए distilled नतीजों को फिर से distill करना पड़ता है
- बड़े language models खुद भी सार्वजनिक internet के ज्ञान को इकट्ठा करके मॉडल में compress करने का नतीजा हैं, इसलिए सिर्फ दूसरे मॉडल के API responses को distill करना गलत ठहराने में विरोधाभास है
- अमेरिका में दो कानूनी कदमों की ज़रूरत है
- मॉडल training के लिए data collection को fair use के रूप में स्पष्ट किया जाना चाहिए
- कम से कम अमेरिकी कंपनियों के लिए distillation पर रोक लगाने वाली terms of service की अनुमति नहीं होनी चाहिए
- API query से अलग पहचानना मुश्किल distillation को रोकने की कोशिश करने के बजाय, labs की learning को कानूनी सुरक्षा देनी चाहिए ताकि उसके नतीजों का उपयोग आगे के innovation में हो सके
असली चिंता का क्षेत्र cyber security है
- Hugging Face का production infrastructure एक autonomous AI agent system द्वारा compromise किया गया, और अमेरिकी frontier मॉडलों के guardrails incident responders और attackers में फर्क न कर पाने के कारण response में बाधा बने
- defense team ने चीन की Z.ai के open source GLM 5.2 को अपने infrastructure पर चलाकर attackers द्वारा छोड़े गए 17,000 से अधिक logs और traces का analysis किया
- Hugging Face सलाह देता है कि incident से पहले ही ऐसे अच्छे मॉडलों को validate कर लें जिन्हें अपने infrastructure पर चलाया जा सके
- इससे guardrails की वजह से access block होने से बचा जा सकता है
- और attack data व credentials को बाहरी environment में जाने से रोका जा सकता है
- जब offensive capability वाले मॉडल पहले से व्यापक रूप से उपलब्ध हों, तो defenders को भी सर्वोच्च प्रदर्शन वाले मॉडलों तक पहुंच मिलनी चाहिए
- Trump प्रशासन के guidance की वजह से defenders व्यावहारिक रूप से Fable या Sol को cyber security में इस्तेमाल नहीं कर सकते, और नतीजतन चीनी मॉडल सबसे अच्छा alternative बन जाते हैं
- अमेरिका को दो नीतियां लागू करनी चाहिए
- Fable और Sol पर लगे cyber security restrictions ढीले किए जाने चाहिए
- अमेरिकी open-weight मॉडल डेवलपर्स को चीन के बराबर शर्तों पर प्रतिस्पर्धा करने की गारंटी दी जानी चाहिए
- अगर frontier labs को safety और security standards पर monopoly बनाने या सामूहिक ज्ञान तक बाद की पहुंच रोकने दिया गया, तो अमेरिकी कंपनियों की defense चीनी मॉडलों पर निर्भर हो जाएगी
- अमेरिकी labs को restrictions के जरिए competition रोकने के बजाय बेहतर मॉडल और बेहतर cost structure के साथ प्रतिस्पर्धा करनी चाहिए, और openness व innovation की पहल चीन को नहीं सौंपनी चाहिए
2 टिप्पणियां
धरती, माफ़ करना
Hacker News की राय
चीनी मॉडलों से सबसे ज़्यादा डर उन venture capital firms को है जिन्होंने Anthropic और OpenAI के खगोलीय valuations में निवेश किया है। Anthropic का लक्ष्य 1.2 ट्रिलियन डॉलर और OpenAI का 850 बिलियन डॉलर है, और ये valuations इस धारणा पर आधारित हैं कि महंगे API से भारी मुनाफ़ा कमाया जा सकेगा
चीनी research labs मुफ़्त में बेहतरीन open models जारी करके इस रणनीति को कमजोर कर रही हैं, और अगर leading labs भी token price घटाने की प्रतिस्पर्धा में उतरें तो मौजूदा valuations को सही ठहराना मुश्किल होगा और investors को भारी paper losses झेलने पड़ेंगे
मॉडल सिर्फ़ download करने में मुफ़्त हैं, चलाने में नहीं, इसलिए यह software से ज़्यादा manufacturing economics के क़रीब है। GLM 5.2 से असली काम करके देखा तो वह GPT 5.6 से महंगा पड़ा, और अमेरिकी labs प्रति task inference cost में आगे हैं
agent workloads में inference का हिस्सा बढ़ने पर training cost का हिस्सा घटता है, और token efficiency को distill करना कठिन है, इसलिए चीनी LLM कुछ हद तक inefficient लगते हैं। बड़े inference demand के लिए optimized models प्रति task कम लागत हासिल कर सकते हैं, और OpenAI efficient tokenization और छोटे responses की वजह से Anthropic की तुलना में प्रति task आधे से भी कम लागत पर है, जबकि frontier tasks में चीनी मॉडलों से सस्ता और बेहतर है
enterprises भी tokens पर बहुत पैसा नहीं ख़र्च करेंगे। जब labs को training cost subsidize करने की ज़रूरत नहीं रहेगी तो token cost 10वें हिस्से तक गिर जाएगी, और जब मॉडल chips में उकेरे जाने वाले चरण तक पहुँचेंगे तो फिर 10वें हिस्से तक और घट सकती है, जिससे जानबूझकर कोशिश न की जाए तो meaningful मात्रा में tokens ख़र्च करना भी मुश्किल हो सकता है
Claude Code और Codex के sticky होने के दावों के उलट, मैंने सर्दियों और वसंत में लगभग सिर्फ़ Claude Code इस्तेमाल किया, फिर गर्मियों की शुरुआत में बिना किसी दिक्कत के Codex पर चला गया। उससे पहले Cursor इस्तेमाल करता था और switch वही जैसा था, थोड़े समय के लिए Conductor भी इस्तेमाल किया, लेकिन वह मूलतः Claude/Codex execution environment देने जैसा ही लगा
कुछ साल बाद जब sales rep cost savings का हवाला देकर executives को मनाता है, तो बेहतर product की वजह से नहीं बल्कि कीमत की वजह से फिर switch होता है। मेरी पत्नी की कंपनी में भी, जैसे ही सब लोग नए tool के अभ्यस्त होते हैं, हर 1-2 साल में किसी दूसरी company suite पर स्विच कर दिया जाता है
मैं एक बड़े B2B analytics site चलाता हूँ जो customers का backend data लेती है, और चीन के उत्तर-पश्चिमी शिनजियांग क्षेत्र से, Shenzhen Tencent Computer Systems Company Limited को origin दिखाने वाला भारी traffic देखा गया है। चीन की 4-5 अन्य कंपनियाँ भी customer websites को लगातार hit कर रही हैं
satellite imagery में सस्ती solar energy का इस्तेमाल करने वाले बड़े data center construction दिखाई देते हैं। कुछ महीने पहले से उन IPs की geolocation Shanghai या Shenzhen दिखने लगी है, लेकिन latency measurements से अब भी लगता है कि वे शिनजियांग क्षेत्र में ही चल रहे हैं
संदर्भ सामग्री है ‘You Can't Cheat Time: Finding foes and yourself with latency trilateration’ https://youtu.be/_iAffzWxexA, जिसे HN user lopoc ने दिया था। Shenzhen और शिनजियांग में फर्क करना मुश्किल है, लेकिन Shanghai और शिनजियांग में अंतर दिख जाता है
अगर यह मान लिया जाए कि चीन सिर्फ़ distillation कर रहा है, तो यह बड़ी ग़लतफ़हमी होगी। ByteDance और Xiaomi की तरह, चीन अब सिर्फ़ low-value copying करने वाला पिछड़ा खिलाड़ी नहीं रहा
चीनी कंपनियाँ भी अमेरिकी कंपनियों की तरह लोगों को भुगतान करके और web crawl करके data हासिल करती हैं। मेरी समझ यह है कि सरकार कुछ बड़ी कंपनियों को तेज़ी से web collect करके corpora बनाने और फिर उन्हें चीन के strategic enterprises को देने के लिए प्रोत्साहित करती है
apps·websites·services data खरीदने वाले aggregators भी हैं, और OpenRouter या Cursor जैसे systems के ज़रिए coding agents और conversations के execution traces पर भी training की जा सकती है। इसकी वजह से DeepSeek जैसी छोटी कंपनियों को सीधे सैकड़ों sites और coding agents से data इकट्ठा करने की ज़रूरत नहीं पड़ती, जिससे cost बहुत घट जाती है
ऐसी कंपनियाँ भी हैं जो अमेरिकी LLM APIs खरीदकर उन्हें चीनी कंपनियों तक relay करती हैं। भले ही अमेरिकी AI products इस्तेमाल करने वाली कंपनियाँ 10,000 से ज़्यादा हों, चीन उनके usage patterns और execution traces को रिकॉर्ड करके training में इस्तेमाल कर सकता है
“Anthropic और OpenAI के लिए frontier-level intelligence की प्रति unit लागत सबसे कम होने की संभावना है” — यह मुख्य धारणा पर्याप्त रूप से साबित नहीं हुई है। समान परिस्थितियों में एक उत्तर पाने के लिए कितने tokens चाहिए, इसकी तुलना करने वाला कोई benchmark भी नहीं है, और बस इतना धुंधला संकेत है कि अमेरिकी models अधिक token-efficient हैं
चीन और अमेरिका की औसत बिजली कीमत की भी तुलना नहीं की गई, जबकि इस मामले में चीन बेहतर दिखता है। यह मानने से सहमति है कि coding benchmarks आदि cost of goods sold को नज़रअंदाज़ करते हैं, लेकिन “frontier labs ठीक रहेंगे” वाला निष्कर्ष बहुत बड़ी धारणाओं पर टिका है
अगर इंटरनेट के सार्वजनिक ज्ञान को scrape करके LLM बनाना स्वीकार्य है, तो उस model को फिर distill करना भी स्वीकार्य होना चाहिए। training data collection को fair use बताकर distillation पर रोक लगाने वाले terms of service को रोकने का प्रस्ताव काफ़ी हद तक जैसी करनी वैसी भरनी जैसा है
इंटरनेट को public good मानकर labs पर tax लगाया जा सकता है, लेकिन यह distillation से अलग मुद्दा है
सीधे agent execution environments बनाकर देखने पर लगा कि AI की performance लगभग पूरी तरह model खुद से आती है, execution environment से नहीं। benchmark के लिए mini-swe-agent जैसी न्यूनतम setup भी model को काम अच्छी तरह करने देती है
इसलिए execution environment को moat मानने वाले दावे पर संदेह है, खासकर क्योंकि Claude Code में पहले से ही बहुत bugs रहे हैं
संबंधित लेख है https://stratechery.com/2026/anthropics-safety-superpower/। अगर कोई user touchpoint का मालिक बन जाए और हर काम का canvas बन जाए, तो मज़बूत lock-in पैदा होता है; इसलिए software के general-purpose input बने नहीं रहना चाहने वाली frontier labs और मौजूदा software companies के बीच अंततः टकराव होगा
“चीनी बना” और “अविश्वसनीय” को एक जैसा मान लिया जाता है, लेकिन ज़्यादा महत्वपूर्ण फ़र्क open और closed का है। open models का audit और fine-tuning किया जा सकता है, और उन्हें अपने hardware पर पूरी तरह चलाया भी जा सकता है, जबकि closed models मूलतः “हम पर भरोसा करो” वाले ढाँचे पर चलते हैं
अमेरिका से शुरू करके पूरी दुनिया को चीन की frontier labs पर नज़र रखनी चाहिए। यह मानकर नहीं चल सकते कि चीन हमेशा कुछ महीनों पीछे रहेगा; वह बराबरी पर भी हो सकता है या आगे भी निकल सकता है
steel, solar और EVs से मिली सीख policy makers को लेनी चाहिए। चीन की सरकार जिस तरह पूरे उद्योग पर पकड़ बनाने वाली व्यवस्था खड़ी करती है, उसे सम्मान के साथ समझने और अध्ययन करने की ज़रूरत है; और अगर व्यवस्था नहीं बदली तो लोकतांत्रिक देशों में स्वभावतः AI adoption धीमा ही रहेगा
अमेरिका, यूरोप और भारत जैसी लोकतांत्रिक सरकारों को सरकार बदलने के बावजूद लागू रहने वाली दीर्घकालिक AI रणनीति बनानी चाहिए और अपने घरेलू labs की पूरी तरह रक्षा करनी चाहिए। हालांकि यह तभी संभव है जब productive tasks के हिसाब से उनकी intelligence pricing open-weight models के करीब हो, और अभी ऐसा नहीं है
संरक्षण का मतलब bailout नहीं, बल्कि सस्ती ऊर्जा और data center approvals तेज़ी से देना है। साथ ही, कम से कम इतने safety guardrails होने चाहिए कि open-weight models का उपयोग ग्राहक तभी करें जब देश की अपनी कंपनियाँ उन्हें देश के भीतर host करें; नहीं तो प्रतिस्पर्धात्मक क्षमता धीरे-धीरे घट सकती है
लगता है OpenAI के @deanwball भी distillation logic को स्वीकार नहीं करते: https://xcancel.com/deanwball/status/2078133895766114412#m
यह भी समझना मुश्किल है कि open weights स्वभावतः प्रगति को धीमा क्यों करेंगे, और open models-केंद्रित दुनिया क्यों राज्य द्वारा AI को digital public infrastructure की तरह उपलब्ध कराने वाले पूर्ण AI communism और dystopia में बदल जाएगी
अगर Anthropic के पास Mythos जैसा model था, तो यह बहुत संभव है कि रूस और चीन जैसे प्रतिद्वंद्वी देश भी पहले से वैसी ही या उससे बेहतर चीज़ बना चुके हों, या कम से कम बहुत पीछे न हों