3 पॉइंट द्वारा GN⁺ 15 시간 전 | 2 टिप्पणियां | WhatsApp पर शेयर करें
  • चीन का open-weight मॉडल Kimi K3 अत्याधुनिक मॉडलों के करीब पहुंच गया है, लेकिन AI बिज़नेस की प्रतिस्पर्धात्मकता मॉडल डेवलपमेंट लागत से ज़्यादा उस cost of goods sold (COGS) पर तय होती है जो सही जवाब के स्तर की intelligence देती है
  • हर मॉडल को सही जवाब तक पहुंचने के लिए अलग-अलग मात्रा में tokens चाहिए होते हैं, इसलिए token खुद कोई interchangeable commodity नहीं हैं; असल में commodity बन रही चीज़ token से बनाई गई intelligence है
  • Anthropic और OpenAI की ऊंची कीमतें काफी हद तक computing supply की कमी से आती हैं, और भले ही चीनी मॉडल प्रति token सस्ते हों, अगर वे ज्यादा inference tokens इस्तेमाल करें तो cost advantage गायब हो सकता है
  • चीन open-weight मॉडलों के जरिए AI को commodity बनाकर अपने robotics और physical industry को मजबूत करना चाहता है, और distillation के जरिए अमेरिकी अत्याधुनिक मॉडलों को कम-लागत वाले teacher की तरह इस्तेमाल करने का संरचनात्मक लाभ भी लेता है
  • अगर अमेरिका cyber security के लिए अत्याधुनिक मॉडलों पर लगी पाबंदियां ढीली नहीं करता और अपने open-weight डेवलपर्स को distillation की अनुमति नहीं देता, तो अमेरिकी कंपनियों को रक्षा के लिए चीनी मॉडलों पर निर्भर होना पड़ेगा

सॉफ़्टवेयर से अलग हुई AI की cost structure

  • सॉफ़्टवेयर में marginal cost और transaction cost लगभग 0 के करीब होने से मांग पर कब्ज़ा करने वाली कंपनियों को centralization और scale का फायदा मिलता था, लेकिन AI में marginal cost फिर से industry structure तय कर रही है
  • open-weight मॉडल weights बनाने की R&D लागत बचाते हैं, लेकिन service cost को मुफ्त नहीं बनाते
    • R&D लागत revenue से असंबंधित fixed cost है
    • inference cost उपयोग और revenue बढ़ने के साथ बढ़ने वाली cost of goods sold है
  • अगर token generation cost revenue के हर 1 डॉलर पर 0.50 डॉलर है, तो 100 million डॉलर revenue पर 50 million डॉलर COGS होगा, और 100 thousand डॉलर revenue पर 50 thousand डॉलर
  • Kimi K3 की कीमत input के लिए 1 million tokens पर 3 डॉलर और output के लिए 1 million tokens पर 15 डॉलर है, जबकि Sol की कीमतें क्रमशः 5 डॉलर और 30 डॉलर हैं
  • लेकिन केवल token unit price से किसी मॉडल द्वारा वास्तविक intelligence देने की कुल लागत समझना मुश्किल है

commodity token नहीं, intelligence बन रही है

  • अगर Nvidia GPU को मॉडल-स्वतंत्र 'token factory' के रूप में परिभाषित करे, तो tokens per second, time to first token, tokens per watt और token cost प्रमुख metrics बनते हैं
  • ChatGPT युग में, जब tokens सीधे users तक पहुंचाए जाते थे, यह measurement ठीक बैठता था; लेकिन reasoning युग में chain-of-thought tokens बहुत बढ़ जाते हैं और हर मॉडल को सही जवाब के लिए अलग संख्या में tokens चाहिए होते हैं
    • माना जाता है कि Kimi, Sol की तुलना में बहुत ज्यादा tokens इस्तेमाल करता है, इसलिए listed price का फायदा खत्म हो सकता है
    • agent workflow में भी अलग-अलग मॉडलों को काम पूरा करने के लिए अलग token count चाहिए होता है
  • tokens interchangeable नहीं हैं, इसलिए वे crude oil, copper या wheat जैसी commodities नहीं हैं
  • अगर कई मॉडल एक ही सही जवाब बना सकते हैं, तो commodity token नहीं बल्कि सही जवाब के स्तर की intelligence है, और उस जवाब तक पहुंचने में खर्च हुए tokens की संख्या COGS का अंतर बनाती है
  • intelligence का COGS पांच तत्वों से तय होता है
    • model size: weights और runtime state यह तय करते हैं कि serving replica के लिए कितनी महंगी memory और कितने accelerators चाहिए
    • inference efficiency: Mixture-of-Experts जैसी architecture generated token प्रति computation कम करती है
    • memory efficiency: KV cache की जरूरत घटाने से concurrent requests और GPU utilization बढ़ सकते हैं
    • serving efficiency: batching, scheduling, prefix caching आदि requests के बीच काम साझा करके utilization बढ़ाते हैं
    • token efficiency: सही जवाब के लिए जितने कम tokens चाहिए, inference cost उतनी कम होती है
  • एक बेसिक CRUD app पहले से कई providers के मॉडलों से बनाई जा सकती है, इसलिए ऐसे कामों में ऊंची कीमत नहीं बल्कि बेहतर cost structure profitability तय करती है

commodity बाज़ार की price और profit structure

  • commodity बाज़ार में सभी suppliers एक ही चीज़ बेचते हैं, इसलिए कीमत demand और supply से तय होती है
    • कीमत घटने पर demand बढ़ाने वाली price elasticity काम करती है
    • supply volume commodity बनाने की marginal cost पर निर्भर करता है
  • हर supplier की marginal cost अलग होने से सबसे महंगे marginal supplier की लागत market price तय करती है, और बाकी suppliers का profit इस बात पर निर्भर करता है कि वे उससे कितना सस्ता उत्पादन करते हैं
  • अगर supplier A, B, C क्रमशः 10, 15, 20 डॉलर प्रति unit पर 10-10 units बनाते हैं, और 20 डॉलर की कीमत पर demand 25 units है, तो स्थिति ऐसी होगी
    • A, 10 units बेचकर प्रति unit 10 डॉलर कमाता है
    • B, 10 units बेचकर प्रति unit 5 डॉलर बचाता है
    • C, 5 units बेचता है लेकिन प्रति unit कोई profit नहीं कमाता
  • व्यवहार में A और B, C से थोड़ा कम दाम रख सकते हैं और price change demand को भी प्रभावित करेगा, लेकिन सबसे महंगे supplier के दिवालिया होने का जोखिम उठाने वाली संरचना वही रहती है
  • market-clearing price में R&D लागत या equipment procurement debt जैसी fixed cost शामिल नहीं की जा सकती, लेकिन ये लागतें कम-लाभ वाले suppliers को बाहर कर सकती हैं
  • suppliers के बाहर होने पर, जब तक दूसरे suppliers प्रवेश न करें या मौजूदा suppliers capacity न बढ़ाएं, कीमतें बढ़ती हैं

मौजूदा intelligence बाज़ार में चीनी मॉडलों की स्थिति

  • अभी अत्याधुनिक मॉडल बाज़ार में computing shortage के कारण demand supply से अधिक है, इसलिए यह पूरी तरह commodity market की शर्तें पूरी नहीं करता
  • Nvidia ऊंचे margin पर computing देता है, और SpaceXAI जैसे ग्राहक इसे Anthropic को फिर ऊंचे margin पर resell भी करते हैं, इसलिए Anthropic tokens पर और ऊंची कीमत लगा सकता है
  • संभव है कि Anthropic और OpenAI model performance, serving scale और token efficiency की वजह से अत्याधुनिक गुणवत्ता वाली intelligence की unit cost के लिहाज़ से सबसे कम-लागत वाले समूह हों
    • वे competitors से कई महीने पहले किसी खास performance level तक पहुंचते हैं
    • वे अपने सबसे अच्छे मॉडलों का उपयोग फिर cost optimization के लिए करते हैं
  • बाज़ार की demand अभी abstract intelligence की बजाय सीधे Anthropic और OpenAI की ओर जाती है, और अपेक्षाकृत कमज़ोर SpaceXAI और Meta, Anthropic को capacity बेचते हैं
  • अगर काम को जरूरी intelligence level के रूप में परिभाषित किया जाए, तो खरीदार supplier बदल सकने वाला commodity market बनाया जा सकता है
  • लंबी अवधि में अत्याधुनिक मॉडल कुछ महीनों बाद non-frontier market में नीचे आ जाते हैं, और इस दौरान डेवलपर्स serving cost optimize कर सकते हैं, इसलिए frontier कंपनियों को निचले बाज़ारों में भी बढ़त मिलती है
  • चीनी मॉडलों की कम listed price, Anthropic और OpenAI की उन ऊंची कीमतों से तुलना का नतीजा हो सकती है जो supply shortage की वजह से तय हुई हैं
  • इस बात के पर्याप्त प्रमाण नहीं हैं कि Kimi marginal cost के हिसाब से सच में सस्ता है, और token efficiency को जोड़ने पर चीनी मॉडलों पर आर्थिक प्रतिक्रिया बढ़ा-चढ़ाकर हो सकती है

frontier labs चीनी मॉडलों से क्यों सतर्क हैं

  • frontier labs उस दौर की financial structure से बंधे हुए हैं जब training, inference की तुलना में ज्यादा GPU खाती थी
    • अगली training को support करने के लिए उन्हें inference revenue maximize करना पड़ता था, और इसके लिए ऊंची inference pricing चाहिए थी
    • आगे training cost लगातार बढ़े तब भी inference market उससे तेज़ी से बढ़ने की उम्मीद है
    • agent paradigm ने बड़े पैमाने की demand खोल दी है, इसलिए पर्याप्त computing मिलने पर कम कीमत और ज्यादा usage के साथ growth संभव है
  • intelligence कोई perfect commodity नहीं है; वास्तविक उपयोग के दौरान जुटा data अगला मॉडल और स्मार्ट बनाता है
    • computing supply बढ़ने पर कीमत घटाकर usage और data दोनों बढ़ाने की incentive पैदा होती है
    • Microsoft की enterprise self-hosted model execution support पर केंद्रित strategy भी तब ज्यादा viable होती है जब चीनी मॉडल एक वास्तविक alternative की तरह काम करें
  • frontier labs customer experience तक फैलकर चीनी मॉडलों और दूसरी labs से खुद को अलग कर सकते हैं
    • Claude Code और Codex में users जिस harness को पहले चुनते हैं, उसमें टिके रहने की मजबूत persistence दिखती है
    • यह persistence non-technical users में और अधिक मजबूत हो सकती है
    • labs का upper layer में प्रवेश, Microsoft समेत software vendors के लिए खतरा बनता है
    • जिन software कंपनियों ने पहले से customer experience पर कब्ज़ा किया है, वे competitive मॉडलों तक बेहतर पहुंच होने पर labs की घुसपैठ का अधिक आसानी से विरोध कर सकती हैं
  • Anthropic का रुख है कि शक्तिशाली AI को संभालने के लिए केवल उसी पर भरोसा किया जा सकता है, और open-weight alternatives यह आधार ही तोड़ देते हैं

चीन की open-weight strategy

  • Alibaba के Qwen3.8 Max में 2.4 trillion parameters हैं, और कंपनी इसे Anthropic की Fable 5 के बाद दूसरे स्तर का बताती है
    • Moonshot AI के Kimi K3 में 2.8 trillion parameters हैं
    • Qwen3.8 Max, Qoder सहित Alibaba के coding platform पर उपलब्ध है
    • Alibaba preview के बाद weights जारी करने की योजना बना रही है
    • चीनी मॉडलों की मांग बढ़ने पर Moonshot ने नए subscriptions लेना अस्थायी रूप से रोक दिया
  • Alibaba ने पहले frontier model weights जारी करना बंद किया था, लेकिन अब फिर open-weight पर लौट आई है
  • Xi Jinping के AI भाषण में open source, openness, cooperation और sharing को प्रोत्साहित किया गया, और इस बात पर ज़ोर दिया गया कि AI digital world से physical world की ओर बढ़ रहा है
    • इसमें कहा गया कि AI का उपयोग traditional industries के transformation, emerging industries की growth और future industries की planning में हो ताकि सभी industries और enterprises लाभ उठा सकें
  • चीन की strategy अपने घरेलू उद्योगों को complement करने वाले AI को commodity बनाना है
    • जिन क्षेत्रों में चीन मजबूत है, जैसे physical world और robotics, वे व्यापक रूप से उपलब्ध AI मॉडलों से लाभ उठा सकते हैं
    • इससे अमेरिका को AI में asymmetric advantage पाने से रोका जा सकता है और अमेरिकी frontier labs की ताकत कम की जा सकती है
    • साथ ही open ecosystem से पैदा होने वाले innovation को भी absorb किया जा सकता है

distillation से बनता संरचनात्मक अंतर

  • यह संभावना कम है कि चीन frontier labs के खिलाफ distillation attack रोकने वाला है
  • चीन की labs की पूरी सफलता को distillation पर थोपना भी गलत है, और distillation के बड़े लाभ से इनकार करना भी गलत है
  • पिछले एक साल में post-training reinforcement learning मॉडल performance के लिए ज्यादा महत्वपूर्ण हुई है, इसलिए distillation का असर बढ़ा है
    • चीनी labs को reinforcement learning environment शुरू से नहीं बनाना पड़ता; वे frontier models को teacher की तरह इस्तेमाल कर सकती हैं
    • इससे वे बहुत कम लागत पर तेजी से सुधार करती हैं
    • distillation, चीनी मॉडलों की कम development cost समझाने वाला एकमात्र कारण नहीं है, लेकिन यह महत्वपूर्ण कारण है
  • पश्चिम में भी चीनी मॉडल खुद distillation के लिए इस्तेमाल हो रहे हैं
    • open-weight मॉडल जारी करने वाली Thinking Machines, reinforcement learning की cold start problem हल करने के लिए चीनी मॉडलों पर निर्भर है
  • Dean Meyer और Konstantine Buhler के analysis के अनुसार चीनी labs के पास बेहतरीन researchers, large-scale computing, मजबूत pre-training models, software-hardware co-design और बेहतर post-training capabilities हैं
    • distillation, मजबूत base model और frontier-निकट system के बीच की महंगी आखिरी दूरी को compress कर देता है
    • enforcement बड़े पैमाने की distillation को कठिन और महंगा बना सकता है, लेकिन state-backed actors की distillation को खत्म नहीं कर सकता
    • पश्चिमी frontier models जितने आगे बढ़ते हैं, चीनी labs को उतने नए teachers मिलते जाते हैं
  • अमेरिकी open-weight डेवलपर्स को frontier labs की terms of service माननी पड़ती हैं, इसलिए वे चीनी मॉडलों की तुलना में नुकसान में हैं, और अंततः उन्हें चीनी मॉडलों के जरिए distilled नतीजों को फिर से distill करना पड़ता है
  • बड़े language models खुद भी सार्वजनिक internet के ज्ञान को इकट्ठा करके मॉडल में compress करने का नतीजा हैं, इसलिए सिर्फ दूसरे मॉडल के API responses को distill करना गलत ठहराने में विरोधाभास है
  • अमेरिका में दो कानूनी कदमों की ज़रूरत है
    • मॉडल training के लिए data collection को fair use के रूप में स्पष्ट किया जाना चाहिए
    • कम से कम अमेरिकी कंपनियों के लिए distillation पर रोक लगाने वाली terms of service की अनुमति नहीं होनी चाहिए
  • API query से अलग पहचानना मुश्किल distillation को रोकने की कोशिश करने के बजाय, labs की learning को कानूनी सुरक्षा देनी चाहिए ताकि उसके नतीजों का उपयोग आगे के innovation में हो सके

असली चिंता का क्षेत्र cyber security है

  • Hugging Face का production infrastructure एक autonomous AI agent system द्वारा compromise किया गया, और अमेरिकी frontier मॉडलों के guardrails incident responders और attackers में फर्क न कर पाने के कारण response में बाधा बने
  • defense team ने चीन की Z.ai के open source GLM 5.2 को अपने infrastructure पर चलाकर attackers द्वारा छोड़े गए 17,000 से अधिक logs और traces का analysis किया
  • Hugging Face सलाह देता है कि incident से पहले ही ऐसे अच्छे मॉडलों को validate कर लें जिन्हें अपने infrastructure पर चलाया जा सके
    • इससे guardrails की वजह से access block होने से बचा जा सकता है
    • और attack data व credentials को बाहरी environment में जाने से रोका जा सकता है
  • जब offensive capability वाले मॉडल पहले से व्यापक रूप से उपलब्ध हों, तो defenders को भी सर्वोच्च प्रदर्शन वाले मॉडलों तक पहुंच मिलनी चाहिए
  • Trump प्रशासन के guidance की वजह से defenders व्यावहारिक रूप से Fable या Sol को cyber security में इस्तेमाल नहीं कर सकते, और नतीजतन चीनी मॉडल सबसे अच्छा alternative बन जाते हैं
  • अमेरिका को दो नीतियां लागू करनी चाहिए
    • Fable और Sol पर लगे cyber security restrictions ढीले किए जाने चाहिए
    • अमेरिकी open-weight मॉडल डेवलपर्स को चीन के बराबर शर्तों पर प्रतिस्पर्धा करने की गारंटी दी जानी चाहिए
  • अगर frontier labs को safety और security standards पर monopoly बनाने या सामूहिक ज्ञान तक बाद की पहुंच रोकने दिया गया, तो अमेरिकी कंपनियों की defense चीनी मॉडलों पर निर्भर हो जाएगी
  • अमेरिकी labs को restrictions के जरिए competition रोकने के बजाय बेहतर मॉडल और बेहतर cost structure के साथ प्रतिस्पर्धा करनी चाहिए, और openness व innovation की पहल चीन को नहीं सौंपनी चाहिए

2 टिप्पणियां

 
kaydash 6 시간 전

धरती, माफ़ करना

 
Hacker News की राय
  • चीनी मॉडलों से सबसे ज़्यादा डर उन venture capital firms को है जिन्होंने Anthropic और OpenAI के खगोलीय valuations में निवेश किया है। Anthropic का लक्ष्य 1.2 ट्रिलियन डॉलर और OpenAI का 850 बिलियन डॉलर है, और ये valuations इस धारणा पर आधारित हैं कि महंगे API से भारी मुनाफ़ा कमाया जा सकेगा
    चीनी research labs मुफ़्त में बेहतरीन open models जारी करके इस रणनीति को कमजोर कर रही हैं, और अगर leading labs भी token price घटाने की प्रतिस्पर्धा में उतरें तो मौजूदा valuations को सही ठहराना मुश्किल होगा और investors को भारी paper losses झेलने पड़ेंगे

    • यह लेख भी इन मुद्दों को काफ़ी हद तक ठीक से उठाता है। generic goods market में लाभप्रदता marginal cost of production से तय होती है, और पारंपरिक software के विपरीत LLM inference की marginal cost होती है
      मॉडल सिर्फ़ download करने में मुफ़्त हैं, चलाने में नहीं, इसलिए यह software से ज़्यादा manufacturing economics के क़रीब है। GLM 5.2 से असली काम करके देखा तो वह GPT 5.6 से महंगा पड़ा, और अमेरिकी labs प्रति task inference cost में आगे हैं
      agent workloads में inference का हिस्सा बढ़ने पर training cost का हिस्सा घटता है, और token efficiency को distill करना कठिन है, इसलिए चीनी LLM कुछ हद तक inefficient लगते हैं। बड़े inference demand के लिए optimized models प्रति task कम लागत हासिल कर सकते हैं, और OpenAI efficient tokenization और छोटे responses की वजह से Anthropic की तुलना में प्रति task आधे से भी कम लागत पर है, जबकि frontier tasks में चीनी मॉडलों से सस्ता और बेहतर है
    • तो फिर private market में OpenAI के shares खरीदने की कोशिश नहीं करनी चाहिए
    • आख़िरकार मॉडल generic goods बनेंगे, यह बात सब समझते होंगे। consumer market में वही user base और proprietary add-on layer कमाई करेंगे जिनसे ads और upsell संभव हो
      enterprises भी tokens पर बहुत पैसा नहीं ख़र्च करेंगे। जब labs को training cost subsidize करने की ज़रूरत नहीं रहेगी तो token cost 10वें हिस्से तक गिर जाएगी, और जब मॉडल chips में उकेरे जाने वाले चरण तक पहुँचेंगे तो फिर 10वें हिस्से तक और घट सकती है, जिससे जानबूझकर कोशिश न की जाए तो meaningful मात्रा में tokens ख़र्च करना भी मुश्किल हो सकता है
    • चीनी labs ने साबित कर दिया है कि मॉडल खुद moat नहीं हो सकता, और safety concerns भी सिर्फ़ regulatory capture की कोशिश थे। यही वजह है कि OpenAI और Anthropic valuation पर सवाल उठने से पहले exit ढूँढने की जल्दी में हैं
    • इसके उलट, SaaS कंपनियों में निवेश करने वाले venture capital चाहते हैं कि tokens सस्ते generic goods बनें और SaaS·app layer में value जमा हो
  • Claude Code और Codex के sticky होने के दावों के उलट, मैंने सर्दियों और वसंत में लगभग सिर्फ़ Claude Code इस्तेमाल किया, फिर गर्मियों की शुरुआत में बिना किसी दिक्कत के Codex पर चला गया। उससे पहले Cursor इस्तेमाल करता था और switch वही जैसा था, थोड़े समय के लिए Conductor भी इस्तेमाल किया, लेकिन वह मूलतः Claude/Codex execution environment देने जैसा ही लगा

    • व्यक्तिगत उपयोग में यह सही हो सकता है, लेकिन enterprise purchase decisions में switching cost बहुत ज़्यादा होती है। procurement और approval में कई प्रक्रियाएँ लगती हैं, इसलिए एक बार जगह बना लेने वाला product लंबे समय तक बना रहता है
      कुछ साल बाद जब sales rep cost savings का हवाला देकर executives को मनाता है, तो बेहतर product की वजह से नहीं बल्कि कीमत की वजह से फिर switch होता है। मेरी पत्नी की कंपनी में भी, जैसे ही सब लोग नए tool के अभ्यस्त होते हैं, हर 1-2 साल में किसी दूसरी company suite पर स्विच कर दिया जाता है
    • ChatGPT वेबसाइट से Anthropic वेबसाइट, Cursor, Windsurf!, Claude, opencode, ohmypi, Codex होते हुए फिर Cursor पर लौट आया। grok 4.5 fast और Cursor usability का मेल बहुत शानदार है, और मॉडल व execution environment बदलने की लागत लगभग 0 थी
    • form और functionality इतने क़रीब आते जा रहे हैं कि कभी-कभी एक खोलकर दूसरे product समझ बैठता हूँ
    • non-developers के लिए AI workflow बनाना हो तो MCP connectors और कुछ specific features install करने पड़ते हैं, मॉडल व execution environment की quirks को bypass करना पड़ता है, और security boundaries भी सेट करनी होती हैं। इसमें काफ़ी काम लगता है, इसलिए एक बार ठीक से चलने लगे तो ज़्यादातर लोग configuration बदलना नहीं चाहते
    • जिन जानकारों के पास दोनों उपलब्ध हैं, वे तकनीकी हों या नहीं, अक्सर बारी-बारी से दोनों का इस्तेमाल करते हैं। performance gap छोटा है और context के हिसाब से कभी एक, कभी दूसरा मनचाहा काम बेहतर करता है
  • मैं एक बड़े B2B analytics site चलाता हूँ जो customers का backend data लेती है, और चीन के उत्तर-पश्चिमी शिनजियांग क्षेत्र से, Shenzhen Tencent Computer Systems Company Limited को origin दिखाने वाला भारी traffic देखा गया है। चीन की 4-5 अन्य कंपनियाँ भी customer websites को लगातार hit कर रही हैं
    satellite imagery में सस्ती solar energy का इस्तेमाल करने वाले बड़े data center construction दिखाई देते हैं। कुछ महीने पहले से उन IPs की geolocation Shanghai या Shenzhen दिखने लगी है, लेकिन latency measurements से अब भी लगता है कि वे शिनजियांग क्षेत्र में ही चल रहे हैं
    संदर्भ सामग्री है ‘You Can't Cheat Time: Finding foes and yourself with latency trilateration’ https://youtu.be/_iAffzWxexA, जिसे HN user lopoc ने दिया था। Shenzhen और शिनजियांग में फर्क करना मुश्किल है, लेकिन Shanghai और शिनजियांग में अंतर दिख जाता है
    अगर यह मान लिया जाए कि चीन सिर्फ़ distillation कर रहा है, तो यह बड़ी ग़लतफ़हमी होगी। ByteDance और Xiaomi की तरह, चीन अब सिर्फ़ low-value copying करने वाला पिछड़ा खिलाड़ी नहीं रहा
    चीनी कंपनियाँ भी अमेरिकी कंपनियों की तरह लोगों को भुगतान करके और web crawl करके data हासिल करती हैं। मेरी समझ यह है कि सरकार कुछ बड़ी कंपनियों को तेज़ी से web collect करके corpora बनाने और फिर उन्हें चीन के strategic enterprises को देने के लिए प्रोत्साहित करती है
    apps·websites·services data खरीदने वाले aggregators भी हैं, और OpenRouter या Cursor जैसे systems के ज़रिए coding agents और conversations के execution traces पर भी training की जा सकती है। इसकी वजह से DeepSeek जैसी छोटी कंपनियों को सीधे सैकड़ों sites और coding agents से data इकट्ठा करने की ज़रूरत नहीं पड़ती, जिससे cost बहुत घट जाती है
    ऐसी कंपनियाँ भी हैं जो अमेरिकी LLM APIs खरीदकर उन्हें चीनी कंपनियों तक relay करती हैं। भले ही अमेरिकी AI products इस्तेमाल करने वाली कंपनियाँ 10,000 से ज़्यादा हों, चीन उनके usage patterns और execution traces को रिकॉर्ड करके training में इस्तेमाल कर सकता है

  • “Anthropic और OpenAI के लिए frontier-level intelligence की प्रति unit लागत सबसे कम होने की संभावना है” — यह मुख्य धारणा पर्याप्त रूप से साबित नहीं हुई है। समान परिस्थितियों में एक उत्तर पाने के लिए कितने tokens चाहिए, इसकी तुलना करने वाला कोई benchmark भी नहीं है, और बस इतना धुंधला संकेत है कि अमेरिकी models अधिक token-efficient हैं
    चीन और अमेरिका की औसत बिजली कीमत की भी तुलना नहीं की गई, जबकि इस मामले में चीन बेहतर दिखता है। यह मानने से सहमति है कि coding benchmarks आदि cost of goods sold को नज़रअंदाज़ करते हैं, लेकिन “frontier labs ठीक रहेंगे” वाला निष्कर्ष बहुत बड़ी धारणाओं पर टिका है

    • अगर चीनी models को अमेरिकी data centers में चलाया जाए, तो चीनी बिजली कीमत से क्या फ़र्क पड़ेगा, यह सवाल उठता है। Kimi का ख़तरा यह नहीं कि वह Claude के नवीनतम version से बेहतर है, बल्कि यह कि Claude की ज़रूरत ही खत्म हो जाए क्योंकि वह पुराने versions के समान model को अपने hardware पर चला सकता है
  • अगर इंटरनेट के सार्वजनिक ज्ञान को scrape करके LLM बनाना स्वीकार्य है, तो उस model को फिर distill करना भी स्वीकार्य होना चाहिए। training data collection को fair use बताकर distillation पर रोक लगाने वाले terms of service को रोकने का प्रस्ताव काफ़ी हद तक जैसी करनी वैसी भरनी जैसा है

    • अगर LLM copyrighted data पर train कर सकता है, तो fairness के हिसाब से उसे दूसरे LLM के उन outputs पर भी train कर सकना चाहिए जो copyright से सुरक्षित नहीं हैं। हालांकि, terms of service में distillation ban को निषिद्ध करना समझाना मुश्किल है, और क्या OpenAI को यह चुनने की आज़ादी भी न दी जाए कि वह किस तरह के customers चाहता है, यह भी सवाल है
    • distillation ban वैसा ही है जैसे compiler का इस्तेमाल करके एक बेहतर और अधिक efficient नया compiler बनाना प्रतिबंधित कर दिया जाए
    • नहीं तो यह सिर्फ़ वही “दूसरों पर लागू होने वाले नियम” हैं जिन्हें frontier labs ख़ुशी से अपनाते हैं
    • raw data से LLM बनाना value add करता है, जबकि distillation सिर्फ़ value निकालती है — यह एक अंतर है। सीमा धुंधली है और समाधान भी स्पष्ट नहीं, लेकिन पहले इस अंतर को मानना चाहिए
      इंटरनेट को public good मानकर labs पर tax लगाया जा सकता है, लेकिन यह distillation से अलग मुद्दा है
  • सीधे agent execution environments बनाकर देखने पर लगा कि AI की performance लगभग पूरी तरह model खुद से आती है, execution environment से नहीं। benchmark के लिए mini-swe-agent जैसी न्यूनतम setup भी model को काम अच्छी तरह करने देती है
    इसलिए execution environment को moat मानने वाले दावे पर संदेह है, खासकर क्योंकि Claude Code में पहले से ही बहुत bugs रहे हैं

    • यहाँ execution environment का मतलब सिर्फ़ code नहीं बल्कि पूरे end-user product experience से लगता है। Mac app बेहतर है और automated execution style की आदत पड़ जाने से Codex का इस्तेमाल जारी है; design tools या collaboration जैसे workflows जितने ज़्यादा बनते हैं, lock-in उतना बढ़ता है
      संबंधित लेख है https://stratechery.com/2026/anthropics-safety-superpower/। अगर कोई user touchpoint का मालिक बन जाए और हर काम का canvas बन जाए, तो मज़बूत lock-in पैदा होता है; इसलिए software के general-purpose input बने नहीं रहना चाहने वाली frontier labs और मौजूदा software companies के बीच अंततः टकराव होगा
    • model providers subsidized plans को सिर्फ़ अपने execution environments में ही चलने देते हैं, इसलिए ज़्यादातर बंधन वहीं पैदा होता है। बेशक model और execution environment दोनों को साथ बदलना भी एक विकल्प है
    • execution environments भी आख़िरकार commoditized हो जाएँगे, लेकिन अभी, खासकर terminal-based न होने वाले products में, quality का अंतर बहुत मायने रखता है
  • “चीनी बना” और “अविश्वसनीय” को एक जैसा मान लिया जाता है, लेकिन ज़्यादा महत्वपूर्ण फ़र्क open और closed का है। open models का audit और fine-tuning किया जा सकता है, और उन्हें अपने hardware पर पूरी तरह चलाया भी जा सकता है, जबकि closed models मूलतः “हम पर भरोसा करो” वाले ढाँचे पर चलते हैं

    • open-weight models का audit closed models की तुलना में आसान है, लेकिन व्यावहारिक रूप से पकड़ में न आने वाले backdoor छिपे होने की संभावना फिर भी बनी रहती है
  • अमेरिका से शुरू करके पूरी दुनिया को चीन की frontier labs पर नज़र रखनी चाहिए। यह मानकर नहीं चल सकते कि चीन हमेशा कुछ महीनों पीछे रहेगा; वह बराबरी पर भी हो सकता है या आगे भी निकल सकता है
    steel, solar और EVs से मिली सीख policy makers को लेनी चाहिए। चीन की सरकार जिस तरह पूरे उद्योग पर पकड़ बनाने वाली व्यवस्था खड़ी करती है, उसे सम्मान के साथ समझने और अध्ययन करने की ज़रूरत है; और अगर व्यवस्था नहीं बदली तो लोकतांत्रिक देशों में स्वभावतः AI adoption धीमा ही रहेगा
    अमेरिका, यूरोप और भारत जैसी लोकतांत्रिक सरकारों को सरकार बदलने के बावजूद लागू रहने वाली दीर्घकालिक AI रणनीति बनानी चाहिए और अपने घरेलू labs की पूरी तरह रक्षा करनी चाहिए। हालांकि यह तभी संभव है जब productive tasks के हिसाब से उनकी intelligence pricing open-weight models के करीब हो, और अभी ऐसा नहीं है
    संरक्षण का मतलब bailout नहीं, बल्कि सस्ती ऊर्जा और data center approvals तेज़ी से देना है। साथ ही, कम से कम इतने safety guardrails होने चाहिए कि open-weight models का उपयोग ग्राहक तभी करें जब देश की अपनी कंपनियाँ उन्हें देश के भीतर host करें; नहीं तो प्रतिस्पर्धात्मक क्षमता धीरे-धीरे घट सकती है

  • लगता है OpenAI के @deanwball भी distillation logic को स्वीकार नहीं करते: https://xcancel.com/deanwball/status/2078133895766114412#m

    • “open models मूल रूप से decelerationist हैं” — इस दृष्टिकोण को समझना कठिन है। उनका तर्क यह है कि अगर लागत घटेगी तो OpenAI का development investment कम होगा और AI प्रगति की रफ़्तार धीमी पड़ जाएगी, लेकिन यह OpenAI को ही प्रगति का एकमात्र चालक मानने वाला अत्यधिक exceptionalism लगता है
    • यह अनुमान लगाना कि किसी चीनी lab से “AI corona” बाहर निकल जाएगा, हास्यास्पद है
    • एक ओर open-weight models को “AI communism” और “dystopian hell” कहा जाता है, और अगली ही बात में अमेरिकी federal agency बनाकर चीनी open models के उपयोग को दबाने का प्रस्ताव आता है। प्रेरणा के हिसाब से ढाली गई दलीलें बहुत ज़्यादा दिखती हैं
    • उस लेख की कई बातों को आम लोगों की भाषा में समझाने की ज़रूरत है। यह स्पष्ट नहीं है कि चीन को ऐसे उत्कृष्ट models open release करने देने में ख़तरा क्या है, या यह कहने का मतलब क्या है कि चीनी कम्युनिस्ट पार्टी AGI की संभावना को नहीं समझती और Yann LeCun जैसी सोच रखती है
      यह भी समझना मुश्किल है कि open weights स्वभावतः प्रगति को धीमा क्यों करेंगे, और open models-केंद्रित दुनिया क्यों राज्य द्वारा AI को digital public infrastructure की तरह उपलब्ध कराने वाले पूर्ण AI communism और dystopia में बदल जाएगी
  • अगर Anthropic के पास Mythos जैसा model था, तो यह बहुत संभव है कि रूस और चीन जैसे प्रतिद्वंद्वी देश भी पहले से वैसी ही या उससे बेहतर चीज़ बना चुके हों, या कम से कम बहुत पीछे न हों