1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • मौजूदा शीर्षक “DeepSeek pause fundraise after comments on compute gap to US leaked (transcript) [pdf]” का अर्थ ऐसे पढ़ा जा सकता है मानो DeepSeek ने अमेरिका के साथ compute resource gap को पहचानने के बाद फंडरेज़िंग रोक दी हो
    लेकिन ज़्यादातर लोग इसे ऐसे समझेंगे कि compute resource gap पर की गई टिप्पणियाँ लीक होने की वजह से उसने फंडरेज़िंग रोकी, और यह व्याख्या गलत नहीं है

    • “Leaked DeepSeek transcripts reveal plan to pause fundraising due to compute gap” जैसा कुछ बेहतर हो सकता है
      हालांकि यहाँ भी यह साफ़ नहीं है कि compute resource gap से क्या मतलब है, और क्या वही फंडरेज़िंग रोकने की वजह है; इसलिए शीर्षक अलग-अलग बातों को मिलाकर रखा हुआ लगता है
    • दस्तावेज़ को सरसरी तौर पर देखने पर उल्टा दूसरी व्याख्या, यानी लीक के जवाब में निवेश जुटाना रोकना, ज़्यादा सही लगती है
      इसमें कंपनी की गोपनीय जानकारी और अमेरिकी labs का मुकाबला करने की भविष्य की रणनीति काफ़ी मात्रा में शामिल है, इसलिए लीक पर वह काफ़ी नाराज़ हुए होंगे और शायद दंडात्मक कदम के रूप में निवेश रोक रहे हैं। अगर उन्हें लगता कि प्रतिस्पर्धियों की तुलना में उनके पास संसाधन कम हैं, तो फंडरेज़िंग रोकने का कोई कारण नहीं बनता; इस लिहाज़ से पहली व्याख्या तर्कसंगत नहीं है
    • सभी Chinese रिपोर्टें दूसरी व्याख्या की ओर इशारा करती हैं। मुख्य बात यह है कि Liang Wenfeng की निजी investor बातचीत ऑनलाइन लीक हो गई और वह इससे बुरी तरह नाराज़ हो गए
      उदाहरण: https://x.com/_FORAB/status/2081034500101017616?s=20
    • मैंने सोचा था कि शीर्षक की भाषा समझाने वाला लेख पोस्ट करूँ, लेकिन transcript ज़्यादा दिलचस्प लगा। अगर secondary link के रूप में जोड़ा जा सके तो अच्छा होगा
      https://www.bloomberg.com/news/articles/2026-07-25/deepseek-...
      paywall कम सख्त वाली लगभग वही कॉपी https://fortune.com/2026/07/25/deepseek-liang-wenfeng-backer... और https://archive.ph/zpIrG पर देखी जा सकती है
  • थोड़ा और संदर्भ देने वाला लेख https://www.cyberkendra.com/2026/07/deepseek-pauses-fundrais... है
    Bloomberg के अनुसार, US-China AI competition पर Liang Wenfeng की टिप्पणियाँ ऑनलाइन फैलने के कुछ दिनों बाद DeepSeek ने दूसरे investment round के संभावित investors को बताया कि डील रोक दी गई है। Tencent से जुड़े tech media द्वारा जारी 118 बिंदुओं में AGI strategy, chip supply, pricing और talent retention शामिल थे, और Liang ने चीन की कमजोरी को talent नहीं बल्कि resources की arithmetic problem बताया
    खास तौर पर, cutting-edge model training के लिए Huawei 950 chip 2 लाख की ज़रूरत थी, लेकिन सिर्फ़ 16 हज़ार मिले, और उनका अनुमान था कि Huawei की production capacity की कमी कम-से-कम 3 साल तक रहेगी। उन्होंने अमेरिकी labs की तुलना में कहीं कम compute resources के साथ gap को 3–6 महीने तक घटाने का तरीका भी सुझाया

    • यह भी सोचने लायक है कि क्या चीन कम उन्नत logic semiconductor fabs को बड़े पैमाने पर बढ़ाने की रणनीति अपना सकता है। GPGPU और AI, graphics की तुलना में memory bandwidth पर कहीं ज़्यादा निर्भर और कम compute-intensive लगते हैं
      GPU की उम्र बढ़ाने के लिए depreciation कम करना ‘financial trick’ कहा जाता है, लेकिन नए GPU में bandwidth बढ़ोतरी बहुत बड़ी नहीं है, इसलिए उनकी वास्तविक उपयोगी उम्र सच में लंबी हो सकती है। memory कंपनियों के stock तेज़ी से बढ़े हैं, जबकि NVIDIA अपेक्षाकृत ठहरा हुआ है; यह भी शायद उसी बात को दिखाता है। cutting-edge memory manufacturing में चीन का अमेरिका से gap छोटा है, इसलिए उसकी कमजोरी शायद बढ़ा-चढ़ाकर बताई गई हो
    • इससे छोटे models में सुधार और open source करने की संभावना बढ़ती है
      यह भ्रम है कि अमेरिकी AI कंपनियों का तरीका ही सबसे अच्छा है, लेकिन frontier models बहुत फूले हुए हैं और speed improvements की सैकड़ों संभावनाएँ हो सकती हैं। अगर open weights को आगे बढ़ाया जाए, तो ऐसी अक्षमताएँ लगातार कम की जा सकती हैं
  • अगर चीन के open-weight models अमेरिका की बराबरी कर रहे हैं और लागत के सिर्फ एक हिस्से में frontier-level performance दे पा रहे हैं, तो आखिरकार AI models एक commodity बन जाएंगे, और अमेरिकी labs के अरबों-खरबों डॉलर के निवेश से बस घटता हुआ रिटर्न ही मिलेगा—क्या उनकी बढ़त भी सिर्फ अस्थायी है?
    अगर ऐसा है, तो फिर DeepSeek भी वही रास्ता क्यों अपना रहा है, यह समझ नहीं आता; जब performance gap अस्थायी है और लागत बहुत भारी है, तब बिल्कुल frontier पर होना क्या सच में इतना ज़रूरी है?

    • अमेरिकी policymakers मानते हैं कि अगर gap सिर्फ 6 महीने~1 साल का भी हो, तो जो पक्ष पहले AGI तक पहुंचेगा उसे इतनी बढ़त मिल सकती है कि वह दुश्मन देशों को लगभग निष्क्रिय कर दे। वे cyberwarfare और weapons of mass destruction जैसी चीज़ों का ज़िक्र करते हैं, जिससे इसका मतलब समझा जा सकता है। दूसरी ओर Jensen Huang AI को marathon मानते हैं
    • DeepSeek को hedge fund High-Flyer से फंडिंग मिलती है, और token pricing भी जानबूझकर सिर्फ server cost वसूलने के स्तर तक सीमित रखी जाती है
      ट्रांसक्रिप्ट में इसे नैतिक जिम्मेदारी कहा गया है, और बताया गया है कि उन्हें image/video generation या world models के hype में दिलचस्पी नहीं है; वे सिर्फ reasoning, thought process, और continual learning पर फोकस करते हैं
    • पेपर इस हिस्से को काफी ईमानदारी से रखता है और कहता है कि DeepSeek से top-tier company बनने की उम्मीद नहीं की जाती, न ही यह उसका लक्ष्य है
      दुनिया पर प्रभुत्व नहीं, बल्कि large language models की प्रगति में लगातार अपना योगदान देना उसका रास्ता है, और commercialization एक दूर का लक्ष्य भर है। यह देखते हुए कि वह पहले से सेवा दे रहा है, यहां commercialization का मतलब शायद काफी बड़ा मुनाफा कमाना है। इस रवैये को देखते हुए, लीक के जवाब में fundraising रद्द करना भी समझ में आता है
    • investor meeting में Liang की बातों से लगता है कि वह AGI पर पूरी तरह आश्वस्त है और सब कुछ उसी पर दांव लगा रहा है। अगर AGI आ गया तो हालात पूरी तरह बदल जाएंगे, ऐसा वह मानता दिखता है, लेकिन labor और consumer markets पर उसका असर इतना बड़ा होगा कि असली आर्थिक प्रभाव का अनुमान लगाना मुश्किल है
      वह मानता है कि अभी लंबा रास्ता बाकी है और बीच में लागत की वसूली भी करनी होगी, लेकिन उसका मानना है कि short-term profit पर फोकस करने से AGI सफलता की संभावना घटती है, और AGI जो value ला सकता है उसके सामने यह मामूली बात है। वह संयम को organizational culture के रूप में जोर देता है, और सिर्फ performance improvement नहीं बल्कि breakthrough पर भरोसा करते हुए AI में निवेश जारी रखता है
    • चीन की state-backed कंपनियों के बहुत प्रचार के कारण सिर्फ कुछ लागत में विकसित करने का दावा विवादास्पद है। Singapore जैसे तीसरे देशों के जरिए बड़े पैमाने पर GPU smuggling के संकेत हैं, लेकिन चीन इसे खुलकर स्वीकार नहीं कर सकता
      अगर distillation की बात हो, तो यह शुरुआत से train करने की तुलना में बहुत सस्ता होगा, और चीन में labor cost भी अमेरिका से कम है। Anthropic का दावा है कि Alibaba ने 2026 के अप्रैल~जून में लगभग 25,000 फर्जी accounts के जरिए Claude के साथ 2.88 करोड़ interactions किए, लेकिन यह भी संभव है कि इनमें कुछ या सब agent के जरिए automated रहे हों
  • repository को force push किया गया, इसलिए पुराने links टूट गए, लेकिन फाइल अभी भी https://github.com/demo-zexuan/liang-wenfeng-investor-meetin... पर देखी जा सकती है

    • DeepSeek की internal thinking को समझने के लिए ये दस्तावेज़ खास तौर पर बहुत मूल्यवान हैं। reasoning की कीमत ऐसे स्तर पर तय करने वाली बात दिलचस्प है, जहां 10 महीनों के भीतर capex की वसूली हो जाए और उससे ज़्यादा न लिया जाए
      Liang Wenfeng की प्रेरणा पश्चिम में आम तौर पर दिखने वाले उद्यमियों से साफ़ तौर पर अलग है
  • यह ट्रांसक्रिप्ट Anthropic या OpenAI चलाने वाले भव्य भ्रमों में जीने वाले executives के बयानों से बहुत अलग पढ़ी जाती है

    • पता नहीं उन्होंने Anthropic और OpenAI की investor meeting transcripts भी पढ़ी हैं या नहीं। कंपनी के आधिकारिक दस्तावेज़ कैसे लिखे जाते हैं, यह देखना हो तो IPO filings पढ़नी चाहिए, और अगर अभी वैसा दस्तावेज़ उपलब्ध न हो, तो SpaceX दस्तावेज़ में “CAUTIONARY STATEMENT REGARDING FORWARD-LOOKING STATEMENTS” सेक्शन देखा जा सकता है
      https://www.sec.gov/Archives/edgar/data/1181412/000162828026...
    • समझ नहीं आता कि OpenAI और Anthropic को बार-बार एक ही श्रेणी में क्यों रखा जाता है। OpenAI को बुरा माना जा सकता है, लेकिन Anthropic उससे कहीं अधिक गंभीर मामला है, तुलना के लायक भी नहीं
      हाल की open-weight/open-source चिट्ठी पर OpenAI समेत बड़ी tech कंपनियों ने हस्ताक्षर किए थे, लेकिन Anthropic ने नहीं, और उसके कर्मचारियों को https://x.com/Mononofu/status/2080937562739531837 जैसी बातों के कारण X पर तीखी आलोचना झेलनी पड़ रही है। ऐसा लगता है कि वे मानते हैं कि उनके अलावा बाकी सब मूर्ख हैं, आसानी से भड़काए जा सकते हैं, और AI उन्हें सौंपा नहीं जा सकता; नियंत्रण सिर्फ उनके पास होना चाहिए। सत्ता और धन का पीछा करने वाले management को कर्मचारी वैचारिक रूप से सहारा देते हैं और एक cult-जैसी संस्कृति बन गई है, और सार्वजनिक रूप से दिखने वाला राजनीतिक खर्च भी 2 करोड़ डॉलर से बढ़कर 4 करोड़ डॉलर हो गया है
  • मुख्य लक्ष्य AGI है, और उसकी बुनियाद continual learning है। हर कोई इसे लागू करने का तरीका खोज रहा है, और फिलहाल agent execution-based तरीका सबसे संभावित लगता है
    मैं भी https://github.com/rush86999/atom में इसी समस्या पर काम कर रहा हूं

  • लगता है दस्तावेज़ फिर से हटा दिया गया है, लेकिन Liang के बयान दूसरी जगहों पर भी देखे जा सकते हैं
    [1] https://aiproem.substack.com/p/must-read-deepseek-liang-wenf...

  • बयान का मूल बिंदु यह लगता है कि वास्तव में NVIDIA H200 खरीदने के लिए जरूरी संसाधनों की कमी है। Liang ने कहा कि अगर वह इस साल 2 अरब डॉलर खर्च कर सके, तो इसका मतलब होगा कि procurement विभाग ने शानदार काम किया है, और अमेरिका के साथ मुख्य अंतर मानव संसाधन नहीं बल्कि संसाधन हैं, तथा फिलहाल सबसे बड़े मॉडल की training cost वहन करना संभव नहीं है
    Trump ने अपने पहले कार्यकाल में चीन के semiconductor उद्योग के विकास को रोकने पर केंद्रित trade war शुरू किया था, और जवाब में चीन ने EV, LiDAR, solar power जैसे advanced industries में तेज़ बढ़त हासिल की। दूसरे कार्यकाल में उसने NVIDIA के China को chip sales रोक दिए, लेकिन जब चीनी semiconductor उद्योग ने चौंकाने वाली प्रगति की तो वह पीछे हट गया, और इसके बाद चीन ने अपने घरेलू उद्योग को समर्थन देने के लिए उल्टा घरेलू कंपनियों द्वारा NVIDIA खरीद पर रोक लगा दी। EUV तक पहुंचने में अभी कई साल बाकी हैं, लेकिन फिलहाल 14nm से बड़े process वाले ज़्यादातर chips का उत्पादन वह खुद कर रहा है और तेज़ी से बढ़ रहा है

    • यह दिलचस्प है कि अब चीन विदेशी chips को रोक रहा है। यह निर्णायक संकेतक नहीं है, लेकिन अगर वह इस निष्कर्ष पर पहुंच चुका है कि प्रतिस्पर्धी का अमेरिकी संसाधनों का उपयोग करना उल्टा अमेरिका की मदद करना है, तो यह अमेरिकी प्रभुत्व के लिए अच्छा संकेत नहीं है
  • यह जानने की जिज्ञासा है कि Huawei की production capacity को सीमित करने वाला मूल कारण क्या है। चीन ने ज़रूरत पड़ने पर scale बढ़ाने की क्षमता दिखाई है, इसलिए अगर बात सिर्फ़ पहले से ज्ञात तकनीक के साथ और equipment जोड़कर production बढ़ाने की होती, तो वह अब तक विस्तार कर चुका होता

    • training में इस्तेमाल होने वाले high-performance chips की yield बहुत कम है, और कम yield स्वीकार करते हुए production बढ़ाने के लिए जरूरी पुराने ASML equipment भी वह अतिरिक्त रूप से हासिल नहीं कर पा रहा है
      high-performance chips का आर्थिक रूप से घरेलू उत्पादन करने की तकनीकी नींव तैयार करने में अभी भी कई साल से लेकर 10 साल तक लग सकते हैं
    • Huawei chips की प्रतिस्पर्धात्मकता बनाए रखने के लिए advanced 3D packaging जरूरी है, लेकिन process इतना जटिल है कि yield अब भी कम है। DeepSeek ही नहीं, कई जगहों से demand अधिक है, और Huawei खुद भी एक बड़ा उपभोक्ता है