1 पॉइंट द्वारा GN⁺ 2024-10-30 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • OpenAI AI inference chip विकसित कर रहा है और foundry network योजना को छोड़ रहा है
  • Broadcom, OpenAI की chip design में मदद कर रहा है और TSMC में उसके निर्माण को संभव बनाने में सहयोग दे रहा है
  • OpenAI, chip supply में विविधता लाने के लिए AMD के AI chips भी जोड़ रहा है

OpenAI के internal chip design प्रयास और industry partnership का उपयोग

  • OpenAI, chip supply में विविधता लाने और लागत घटाने के लिए कई विकल्पों की समीक्षा कर रहा है
  • कंपनी फिलहाल अपनी महत्वाकांक्षी foundry योजना को रोककर internal chip design प्रयासों पर ध्यान केंद्रित करने की योजना बना रही है
  • OpenAI की strategy यह दिखाती है कि Amazon, Meta, Google और Microsoft जैसे बड़े प्रतिस्पर्धियों की तरह industry partnership तथा internal और external दोनों तरीकों का उपयोग करके chip supply कैसे सुरक्षित की जा सकती है और लागत को कैसे नियंत्रित किया जा सकता है
  • OpenAI, chip खरीदने वालों में सबसे बड़े खिलाड़ियों में से एक है, और custom chips विकसित करते हुए कई chipmakers से sourcing करने का उसका फैसला tech industry पर व्यापक प्रभाव डाल सकता है
  • Broadcom, Google जैसी कंपनियों को manufacturing के लिए chip design को fine-tune करने में मदद करता है, और ऐसे design components उपलब्ध कराता है जो chips के भीतर information को तेज़ी से स्थानांतरित करने में सहायक होते हैं
  • OpenAI ने Broadcom के माध्यम से TSMC की manufacturing capacity सुरक्षित की है, जिससे वह 2026 में अपना पहला custom-designed chip बना सकेगा
  • इस समय Nvidia के GPU की market share 80% से अधिक है
  • लेकिन supply shortage और बढ़ती लागत के कारण Microsoft, Meta और अब OpenAI जैसे बड़े ग्राहक internal या external alternatives तलाश रहे हैं
  • Microsoft के Azure के जरिए AMD chips का उपयोग करने का OpenAI का फैसला दिखाता है कि AMD का नया MI300X chip उस बाजार के एक हिस्से को हासिल करने की कोशिश कर रहा है, जिस पर Nvidia का दबदबा है
  • AI model training और ChatGPT जैसी services का संचालन महंगा है
  • OpenAI को इस साल 3.7 अरब डॉलर के revenue पर 5 अरब डॉलर के नुकसान की उम्मीद है
  • computing cost कंपनी का सबसे बड़ा खर्च है, जिसने utilization को optimize करने और vendors में विविधता लाने के प्रयासों को प्रेरित किया है

GN⁺ की राय

  • OpenAI के internal chip design प्रयास और विभिन्न chipmakers के साथ उसका सहयोग AI industry में एक महत्वपूर्ण बदलाव का संकेत देते हैं। इससे Nvidia के प्रभुत्व को चुनौती देने वाले नए alternatives बन सकते हैं और AI technology की प्रगति तेज़ हो सकती है
  • हालांकि, OpenAI की cost structure को लेकर चिंताएँ उठ सकती हैं। AI models के विकास और services के संचालन पर भारी खर्च होने की स्थिति में, long-term profitability और sustainability को लेकर सवाल बने हुए हैं
  • दूसरी ओर, AMD के MI300X chip जैसे नए AI chips का आगमन market competition को बढ़ावा देगा और ग्राहकों को अधिक विकल्प देगा। इससे AI technology के व्यापक प्रसार और commercialization में योगदान मिल सकता है
  • AI chip market में बढ़ती प्रतिस्पर्धा के कारण technological innovation के तेज़ होने और high-performance low-power chips की मांग बढ़ने की उम्मीद है। इसके साथ chip design और manufacturing क्षेत्र में investment तथा talent acquisition की प्रतिस्पर्धा भी और तीव्र होने की संभावना है
  • कंपनियों को AI chips अपनाते समय performance, cost, compatibility, scalability जैसे कई कारकों पर समग्र रूप से विचार करना चाहिए। long-term technology roadmap और business strategy के अनुरूप सबसे उपयुक्त chip चुनना महत्वपूर्ण है

1 टिप्पणियां

 
GN⁺ 2024-10-30
Hacker News की राय
  • एक पूर्व Google कर्मचारी के तौर पर यह बिल्कुल चौंकाने वाला नहीं है। Google में अभी भी मौजूद दोस्तों से लगातार संपर्क में हूं, और हाल के महीनों में OpenAI द्वारा Google से आए hardware engineers को ले जाने की संख्या काफी बढ़ गई है
    LinkedIn पर OpenAI के hardware engineer profiles देखने भर से आसानी से पता चल जाता है कि Google से आए लोग कितने ज्यादा हैं। Google की TPU टीम अब अपनी पुरानी छाया भर रह गई है, इसलिए आगे चलकर Google TPU अगर OpenAI की नई chip से पिछड़ जाए तो हैरानी नहीं होगी
    पुराने Google TPU काम में भी Broadcom की मदद पर निर्भरता थी: https://www.theregister.com/AMP/2023/09/22/google_broadcom_t...
    Broadcom ने Google TPU में अच्छी मदद की थी, इसलिए Google से निकले लोगों का उस supplier relationship को नई कंपनी में ले जाना बहुत स्वाभाविक है

    • BRCM अब उन कंपनियों के लिए ASIC design करने वाली service company जैसा बनता जा रहा है जिन्हें custom ASIC चाहिए। ऐसी कंपनियां बहुत हैं, और समझ नहीं आता कि यह खबर क्यों है
      BRCM, Marvell वगैरह के साथ SerDes में अग्रणी है, और Synopsys तथा Cadence की IP भी ऐसी chip कंपनियां बहुत इस्तेमाल करती हैं। कोई भी कंपनी सारी IP को पूरी तरह vertically integrate नहीं करेगी, इसलिए यह कोई बहुत हल्ला मचाने वाली बात नहीं लगती
    • यह भी देखना चाहिए कि Google ने भी TPU पर बहुत समय, पैसा और human capital लगाया और धीरे-धीरे नतीजे मिले। बड़े पैमाने पर scaling में proven कंपनियां भी कोशिश करके असफल रही हैं, जैसे Tesla
      यह PhD लोगों को एक कमरे में बंद करके उनसे LLM निकलवा लेने जितना आसान काम नहीं है। Hardware development मुश्किल, धीमा, लंबे verification वाला और बेहद महंगा होता है
  • Jensen कहते रहे हैं कि demand “पागलपन” जैसी है, और yield कम होने की अफवाहें भी सुनने को मिलती हैं। यह अगले कुछ महीनों या वर्षों तक supply issues में बदल सकता है
    Fortune 500 कंपनियों में कोई भी AI hardware और software का पूरा दांव सिर्फ एक source पर नहीं लगाएगी। single source से हटकर diversify करना समझदारी है

    • हमारी कंपनी के executives से जब पूछा जाता है कि Nvidia क्यों नहीं इस्तेमाल करते, तो वे ठीक-ठीक source diversification ही जवाब देते हैं। मजेदार बात यह है कि हम training के लिए Nvidia बिल्कुल इस्तेमाल नहीं करते
      Nvidia मिल नहीं पा रहा, इसलिए Trainium इस्तेमाल कर रहे हैं
    • “AI hardware और software को पूरे का पूरा single source पर न रखना समझदारी है” वाली बात Microsoft के साथ exclusive contract से कैसे मेल खाती है, यह जानने की उत्सुकता है
      OpenAI/Oracle contract में भी Oracle को अपने datacenter में Azure stack चलाना पड़ता है, ताकि MSFT relationship को mediate कर सके। article में बताए गए AMD chips भी MSFT ने खरीदे हैं
      क्या इसका मतलब यह है कि OpenAI risk और capital expenditure अपने ऊपर लेकर Microsoft को अलग-अलग hardware उपलब्ध कराता है, या फिर कोई और शर्तें हैं, यह जानना चाहूंगा
  • यह कहना कि OpenAI ने खुद सब कुछ बनाने और chip manufacturing के लिए foundry network खड़ा करने हेतु capital raise करने के विकल्प पर विचार किया था, Sam की महत्वाकांक्षा कितनी हास्यास्पद थी, उसे काफी कम करके बताता है
    उसने AI silicon के लिए 36 fabs बनाने के वास्ते किसी तरह 7 trillion dollars जुटाने का idea पेश किया था, और बताया जाता है कि TSMC executives यह सुनकर लगभग उसके सामने ही हंस पड़े थे

    • Sam ने इस दावे पर खुद सफाई दी थी। उसका मतलब था कि demand पूरी करने के लिए अंततः हम सभी को collectively compute पर 7 trillion dollars खर्च करने होंगे, यह नहीं कि OpenAI अकेले 7 trillion dollars जुटाकर सारी production capacity बनाएगा
    • यह हैरानी की बात है कि Satya Nadella ने इस व्यक्ति और उसकी योजना को देखकर सोचा कि “OpenAI सौंपने लायक स्थिर genius यही है”
    • थोड़ी-सी common sense भी होती तो हंसना चाहिए था। 7 trillion dollars कोई ऐसा पैसा नहीं है जो बस raise किया जा सके
      पूरे अमेरिका का domestic net investment भी 1 trillion dollars से कम है: https://fred.stlouisfed.org/series/W790RC1Q027SBEA
      gross fixed capital formation, यानी net investment और depreciation का जोड़, भी बहुत ज्यादा बड़ा नहीं है: https://fred.stlouisfed.org/series/NFIRSAXDCUSQ
      Google, Apple, Microsoft को मिला दें तो भी सालाना capital expenditure 100 billion dollars से कम है। जबकि तीनों कंपनियों का market cap मिलाकर करीब 10 trillion dollars है
      100 billion dollar वाली कंपनी का 7 trillion dollars मांगना अविश्वसनीय रूप से बेतुका है
    • फिर भी किसी मायने में यह प्रभावित करने वाला है। अगर शुरुआत में 7 trillion dollars मांगो, तो बाद में सिर्फ 1 trillion dollars मांगना काफी reasonable लगने लगता है ;-)
    • शायद मैं बहुत cynic हो रहा हूं, लेकिन सिर्फ एक fab की बात भी हंसी लाने के लिए काफी है। design तक तो ठीक है, लेकिन manufacturing?
  • “The Subprime AI Crisis” के भरोसेमंद financial analysis को देखने के बाद, फिल्म “Dodgeball” की line के अलावा मेरे पास जोड़ने को कुछ नहीं है
    “Bold strategy, Cotton. देखते हैं, यह काम करती है या नहीं।”
    0 - https://www.wheresyoured.at/subprimeai/
    1 - https://www.imdb.com/title/tt0364725/quotes/

    • wheresyouredat वाले लेख के जवाब में, ऐसा लगता है कि OpenAI ने free general model को कमजोर कर दिया है, ताकि वह मेरे benchmark पर लगातार अधूरे जवाब दे। जबकि o1 model उसी benchmark को लगातार सही करता है
      पहले free model भी दिन के हिसाब से मेरे benchmark पर ज्यादा accurate जवाब दे देता था। इसलिए ऐसा लगता है कि दोनों के बीच gap बढ़ाकर o1 को ज्यादा useful दिखाया गया है
      OpenAI अपने product के साथ जो चाहे करे, मुझे फर्क नहीं पड़ता, लेकिन मुझे यह free product को nerf करके o1 को तुलनात्मक रूप से बेहतर दिखाने जैसा लगता है
  • नई चिप को production में लाने और training या inference में इस्तेमाल करने में कितना समय लगेगा?

    • अगर टीम अच्छी हो तो लगभग 2 साल। उसके बाद उसे ठीक से चलाने के लिए software चाहिए होगा। यह जल्दी हो सकने वाला काम नहीं है
      ज्यादा पैसा झोंकने से शायद यह तेज हो जाए, लेकिन उल्टा गड़बड़ करके और ज्यादा समय भी लग सकता है
    • यहां समय को उतना महत्वपूर्ण नहीं माना जा रहा। Apple silicon ने performance कैसे बदली और Intel पर निर्भरता कैसे खत्म की, बस वही देखिए
      अगर इसे सही तरह से कर लिया गया, तो दूसरे LLM providers के साथ अंतर और बढ़ाया जा सकता है
    • पहली generation की चिप के असली operations में इस्तेमाल के लिए पर्याप्त न होने की संभावना ज्यादा है, ऐसे में दूसरी generation पर जाना पड़ेगा। इसमें लगभग 3–4 साल लग सकते हैं
  • शायद वे इस चिप का इस्तेमाल करने के लिए अपने data centers बना रहे हैं, लेकिन अजीब है कि article में असल में यह बात कही नहीं गई
    पश्चिमी AI/matrix multiplication chips में क्या कोई ऐसी चिप है जो TSMC में produce नहीं होती? Amazon या Meta शायद अलग हैं? NVIDIA, AMD, Google TPU भी Broadcom design collaboration के साथ TSMC इस्तेमाल करते हैं, और अब OpenAI भी ऐसा ही कर रहा है
    जानना चाहूंगा कि Samsung competitive नहीं है क्या। यह भी जानना चाहूंगा कि कुल chip या chipset volume की सीमा TSMC production capacity की वजह से है, या memory या packaging की वजह से

    • Samsung competitive नहीं है, इसलिए अभी अच्छी chips सब TSMC में ही बनानी पड़ती हैं। AI chips की bottleneck packaging और HBM बताई जाती रही है, लेकिन TSMC भी high utilization पर चल रहा है
    • Samsung लगभग 2–3 साल पीछे है, और HN पर जैसा कहा जाता है उतना भयानक स्तर नहीं है। लेकिन अगर chip को 80% profit margin पर बेचा जा सकता है, तो जाहिर है कोई भी best ही इस्तेमाल करना चाहेगा
  • लगता है OpenAI ने समझ लिया कि brand recognition के अलावा उसके पास असल में कोई moat नहीं है, इसलिए उसने fab और chip design से moat बनाने की कोशिश की
    अगर exclusive fab और chip जादुई तरीके से बेहतर होते, और green team tax दिए बिना सस्ते में बनाए जा सकते, तो inference cost में जबरदस्त फायदा मिलता
    शायद उन्होंने यह भी सोचा होगा कि exclusive chip से शुरुआत करना ही काफी होगा

  • AI में transistors बर्बाद हो रहे हैं, यह विचार बार-बार आता है। Systems में entropy हटाने के लिए हम binary state इस्तेमाल करते हैं, लेकिन AI में कहीं ज्यादा entropy स्वीकार्य है
    इस use case के लिए NAND gate से कहीं बेहतर तरीका इस्तेमाल किया जा सकना चाहिए

    • Binary तरीका इस्तेमाल करने की एक और वजह यह थी कि हाथ से बनाए गए circuits के बजाय synthesis automation संभव था। बड़े scale पर यह वाकई महत्वपूर्ण है
      यह non-recurring engineering cost घटाता है और development speed बढ़ाता है। इसे छोड़ने पर हम वह tool ecosystem भी खो सकते हैं जिसने आज की efficiency संभव बनाई
  • GH Copilot जैसी चीजें शानदार हैं, लेकिन उसके अलावा अभी तक LLM का सामाजिक और सांस्कृतिक असर नहीं दिखा। Influencers की overhyped social media posts को छोड़कर, जिनमें वे cool examples या model releases दिखाते हैं
    यह technology समाज में व्यापक रूप से घुलती-मिलती नहीं दिख रही; सोचता हूं कि क्या मैं immune हूं, या फिर यह SaaS/enterprise products की गहरी layers में छिपी हुई है
    3D TV या VR की तरह “ओह, cool है” पर खत्म होने के बजाय, इसका व्यापक, sticky और high-retention वाला productive cultural impact होना चाहिए
    GPU heatsinks पर इतना पैसा जल चुका है, इसे देखते हुए तो और भी

    • अभी स्कूलों और universities में मौजूद generation LLM को अपनी daily routine का हिस्सा बना रही है
      Education sector के अलावा, LLM के इर्द-गिर्द SEO industry बढ़ी है, और उन्हें बड़े पैमाने पर spam पैदा करने की नई क्षमता बहुत पसंद है
      Enterprise और government क्षेत्रों में, जहां थोड़ी hallucination या robotic corporate tone चल जाती है, communication tasks में productivity बढ़ाने के लिए इसे सावधानी से अपनाया जा रहा है। Final sentences अब भी इंसान ही बनाते हैं
      Customer support और sales में लोग पुराने phone menu tree के “AI” version पर पैसा खर्च कर रहे हैं, जिससे आखिर में इंसान से जुड़ने से पहले “मुझे agent से बात करनी है” चिल्लाना पड़ता है
      बाकी जगह adoption धीमा है। हम deterministic results की उम्मीद करते हैं, लेकिन इन models से ऐसा उम्मीद करना मुश्किल है। LLM API से interact करने वाला software बनाते समय output randomly मांगे गए structure से बाहर जा सकता है, इसलिए 10 साल से ज्यादा समय से इस्तेमाल न की गई defensive coding techniques को फिर से implement करना पड़ता है। इसी वजह से structured output या function calling का उपयोग भी पेचीदा हो जाता है
    • जांचना काफी आसान है। दोस्तों से, हो सके तो non-developer दोस्तों से, पूछिए कि वे इस्तेमाल करते हैं या नहीं
      Accounting में काम करने वाले दोस्त और marketing में काम करने वाले दोस्त को basic analysis या promotional copy लिखने में इसका उपयोग करते देखकर समझ आया कि non-developers भी इसे regularly इस्तेमाल कर रहे हैं
      इस क्षेत्र में non-technical roles का इस्तेमाल महत्वपूर्ण है। Hype के counterexample के तौर पर cryptocurrency को देखें: मेरे जानने वाले non-technical लोग exchanges के जरिए बस “hold” करते थे, claimed use cases को साकार नहीं कर पाए
    • आसपास के लोग और मैं खुद इसे web search के कुछ हिस्से की जगह इस्तेमाल करते हैं
      खासकर o1-preview रुचि वाले सवालों पर broad outline वाले mini review articles लिखने में काफी अच्छा है
      जब उस topic पर पहले से बहुत text मौजूद हो और उसे मेरे सवाल के हिसाब से recombine करना हो, तो यह अच्छा काम करता है
      Chat format web search या संबंधित Wikipedia articles के कुछ पन्ने पढ़ने से कहीं ज्यादा efficient है। सच में यह glass half full या half empty वाला मामला है। इसकी usefulness से काफी प्रभावित हूं और उम्मीदें हैं, लेकिन साथ ही यह निश्चित रूप से AGI नहीं है
    • अजीब है कि media ने usage को ठीक से capture नहीं किया लगता। ज्यादातर journalists और YouTubers केवल मामूली use cases दिखाते हैं
      मैंने unexpected लोगों को तरह-तरह के उद्देश्यों के लिए LLM इस्तेमाल करते देखा है। कई मामलों में वे अपने boss को यह भी नहीं बताना चाहते कि वे tool इस्तेमाल कर रहे हैं, क्योंकि यह उन्हें superpower देता है
      मैं bank employees, store managers, local politicians, small business owners जैसे लोगों की बात कर रहा हूं। पहले मुझे भी यकीन करना मुश्किल था, लेकिन अब लगातार और ज्यादा unexpected लोग LLM इस्तेमाल करते और prompts भी ठीक से structure करते दिख रहे हैं
    • लगता है आप सिर्फ direct consumers के बारे में सोच रहे हैं, लेकिन देखिए कि Microsoft ने Windows में Copilot integrate किया है और उसे लगातार improve कर रहा है
      जब हर Outlook user के पास summarize, extract और email सुधारने के buttons होंगे, तो सैकड़ों मिलियन लोग रोज LMM इस्तेमाल करेंगे
  • अपने fab पर 7 trillion dollars खर्च करने की बात महत्वाकांक्षी होने के साथ-साथ पागलपन भी थी। लगता है आखिरकार reality बीच में आ गई। अगर वे बड़े सपने से जाग गए हैं, तो उम्मीद है quality बनाए रखेंगे

    • लगता है price anchoring का काम पूरा हो गया है, और अब वे असली deal करने के लिए तैयार होने के ज्यादा करीब हैं