- अगर xAI डिफॉल्ट करता है, तो ऋणदाता 2 लाख GPU से बने Colossus का अधिग्रहण करके उसे लीज़ पर दे सकते हैं, लेकिन उसकी वास्तविक कीमत हार्डवेयर से ज़्यादा ऑपरेशनल स्थिति और टीम के tacit knowledge पर निर्भर करती है
- xAI और CoreWeave के केंद्र में GPU-collateral financing फैला है, लेकिन pricing infrastructure की कमी के कारण बेस रेट से लगभग 8.5 प्रतिशत अंक ऊँची loan rates में मापना कठिन जोखिम शामिल हैं
- H100 का किराया 2024 की शुरुआत में लगभग $8 प्रति घंटा से गिरकर अक्टूबर 2025 में $1.70 हो गया, फिर मार्च 2026 में $2.35 तक उछला, इसलिए residual value और future rental income का अनुमान लगाना कठिन है
- एक ही GPU की useful life भी CoreWeave 6 साल और Nebius 4 साल मानते हैं, और NVIDIA का product cycle 2 साल से घटकर 1 साल हो गया है, जिससे book value और recovery value के बीच का अंतर बढ़ सकता है
- GPU collateral में book face value, fire-sale value, और going-concern value जैसी अलग-अलग कीमतें होती हैं, और अगर operational handover विफल हो जाए तो अनुबंध के तहत अधिग्रहित क्लस्टर को revenue-generating asset बनाए रखना कठिन हो जाता है
ऑपरेशन टीम चली जाए तो collateral value बदल जाती है
- GPU क्लस्टर इमारतों से अलग होते हैं; उनकी कीमत ऑपरेशन टीम के बने रहने पर निर्भर करती है, जो provisioning का तरीका, मौजूदा performance और उपकरणों की विशेषताएँ जानती है
- Meta की Llama 3 technical report में H100 16,384 GPUs पर 54 दिनों की training के दौरान 419 अप्रत्याशित interruptions दर्ज किए गए
- इसमें 148 GPU failures और 72 HBM3 memory failures शामिल थे, और आधुनिक datacenter GPUs का वार्षिक failure rate लगभग 9% निकाला गया
- 2 लाख GPUs के पैमाने पर रोज़ लगभग 50 GPUs खराब होंगे, और xAI के 10 लाख GPUs के लक्ष्य पर Epoch AI ने लगभग हर 3 मिनट में एक failure का अनुमान लगाया
- credit risk में सिर्फ़ साफ़ दिखाई देने वाली खराबियाँ ही महत्वपूर्ण नहीं हैं
- silent data corruption (SDC) में GPU रुके बिना गलत परिणाम देता है, जिससे कई दिनों की training सामान्य रूप से पूरी होने के बाद भी model weights खराब हो सकते हैं
- एक GPU से शुरू होने वाला cascading failure हज़ारों उपकरणों पर फैले training job को रोक सकता है, जिससे कई दिनों का compute खो सकता है
- thermal throttling, ECC memory errors, NVLink instability, और bus से GPU गायब हो जाने जैसी समस्याएँ भी लगातार होती रहती हैं
- NVIDIA NVSentinel उस सीमा को संबोधित करता है जहाँ मौजूदा monitoring समस्याएँ पहचान तो लेती है लेकिन हल नहीं कर पाती, और Crusoe AutoClusters cluster effective throughput में सबसे बड़े controllable variable, यानी queue time, को कम करता है
- ऐसे tools के बिना recovery में कुछ घंटे से लेकर कई दिन लग सकते हैं
- ऑपरेशन टीम जानती है कि गर्मियों में कौन-से racks overheat होते हैं, firmware update के बाद कौन-से cooling circuits unstable हो गए, और पूरी तरह fail होने से पहले performance गिराने वाले nodes से किन jobs को reroute करना चाहिए
- यह ज्ञान दस्तावेज़ों से ज़्यादा टीम के अंदर के tacit knowledge के रूप में रहता है, इसलिए यह ऋणदाताओं की balance sheet या access scope में शामिल नहीं होता
वह वित्तीय संरचना जिसमें GPU खुद collateral बन गया
- पिछले 18 महीनों में AI infrastructure financing, corporate credit-based debt से GPU-backed debt की ओर बढ़ा है
- xAI Colossus 2 special purpose vehicle (SPV) लगभग $7.5 billion equity और $12.5 billion debt से बना है
- NVIDIA equity में अधिकतम $2 billion तक निवेश कर रहा है, और Valor Equity Partners equity investment का नेतृत्व कर रहा है
- Apollo और Diameter debt tranches में शामिल हैं
- SPV NVIDIA GPUs खरीदकर xAI को 5 साल के लिए लीज़ पर देता है, और debt xAI की पूरी balance sheet पर नहीं बल्कि GPUs पर secured है
- Morgan Stanley द्वारा जून 2025 में arrange किए गए xAI के $5 billion loan agreement में default की स्थिति में ऋणदाताओं को Memphis के बाहर स्थित Colossus 200,000 GPU cluster का अधिग्रहण कर उसे दूसरी AI कंपनियों को लीज़ पर देकर loan वसूलने का अधिकार मिलता है
- xAI की $5 billion funding की दर अधिकतम 12.5% थी, और CoreWeave के GPU-backed deals में terms बेहतर होने से पहले pricing बेस रेट से लगभग 8.5 प्रतिशत अंक ऊपर थी
- CoreWeave कई SPVs के ज़रिए $18.8 billion के GPU-backed debt का धारक है
- FluidStack और Anthropic का $50 billion agreement अलग संरचना इस्तेमाल करता है, जिसमें Google किराया भुगतान की गारंटी देता है, लेकिन AI infrastructure assets और rental cash flow को financialize करने का तर्क वही है
- ज़्यादातर neoclouds और प्रमुख AI labs इसी तरह धन जुटा रहे हैं
price discovery और hedging tools की कमी
- aircraft, ships, automobiles, commercial real estate, और oil जैसे assets के लिए दशकों में बनी हुई price discovery infrastructure मौजूद है
- aircraft के लिए ISTAT-certified appraisers, global registries, standardized maintenance records, ferry pilots, और 1970s से विकसित second-hand market मौजूद है
- ships के लिए BICA, automobiles के लिए NADA, और Class A offices के लिए standard cap rates व vacancy comps उपलब्ध हैं
- oil के पास 1980s की शुरुआत से forward price curves हैं
- GPU market में बस 2024 में Bloomberg terminal पर लॉन्च हुआ Silicon Data का H100 Rental Index और GPU compute derivatives के लिए पहला regulated exchange बनाने हेतु अक्टूबर 2025 में $5.7 million जुटाने वाली Ornn AI जैसी शुरुआती चीज़ें हैं
- H100 का hourly rent 2024 की शुरुआत में लगभग $8 से गिरकर अक्टूबर 2025 में $1.70 हो गया, फिर अप्रत्याशित inference demand के कारण मार्च 2026 में $2.35 तक 40% उछल गया
- aircraft या ship loans में आम तौर पर ऐसे asset को, जिसकी कीमत इस तरह चलती हो, बिना hedging tools के collateral बनाकर 5 साल का debt underwrite करना मुश्किल होता है
- CoreWeave के GPU-backed loans बेस रेट से लगभग 8.5 प्रतिशत अंक ऊपर हैं, जबकि सामान्य aircraft loans 1–2 प्रतिशत अंक और commercial mortgages अक्सर उससे भी नीचे होते हैं
- अतिरिक्त लगभग 6–7 प्रतिशत अंक उस जोखिम की कीमत है जो ऋणदाता GPU futures market, standardized residual value curves, और future rent lock-in tools की अनुपस्थिति में उठा रहे हैं
- जैसे-जैसे market mature होगा और hedging products, standardized residual value curves, और second-hand GPU market विकसित होंगे, interest rate spreads और AI infrastructure की cost of capital घट सकती है
- उस समय लाभ में वह कंपनी होगी जिसने आज GPU सबसे सस्ते में नहीं खरीदे, बल्कि वह जो financial infrastructure mature होने के बाद low-cost debt तक पहुँच बना सकेगी
GPU useful life को लेकर अनिश्चितता
- CoreWeave GPUs को 6 साल में depreciate करता है, लेकिन वही business model और hardware इस्तेमाल करने वाली Nebius 4 साल मानती है
- AWS, Microsoft, और Google ने 2023 में servers की useful life 3–4 साल से बढ़ाकर 6 साल कर दी
- कुल $300 billion capex के आधार पर इससे वार्षिक reported depreciation expense लगभग $18 billion कम हो जाता है
- CoreWeave ने भी listing से पहले जनवरी 2023 में यही accounting change लागू किया, जिससे वार्षिक reported costs सैकड़ों मिलियन डॉलर कम हो गए
- NVIDIA ने घोषणा की कि 2025 से उसका product release cycle 2 साल से घटकर 1 साल होगा, जिससे debt को secure करने वाले GPUs के पुरानी generation बनने की गति दोगुनी हो जाएगी
- Michael Burry का मानना है कि hyperscalers 2026–2028 के बीच cumulative depreciation expense को लगभग $176 billion कम दिखाएँगे
- उनके हिसाब से 2028 तक Oracle की earnings लगभग 27% और Meta की earnings लगभग 21% ज़्यादा दिखाई जाएँगी
- अगर cutting-edge training GPUs की वास्तविक useful life 2–4 साल के क़रीब है लेकिन books में 6 साल लिखी जाती है, तो book value और recovery value के बीच बड़ा अंतर पैदा होगा
- हाल की inference demand अगर H100 की productive life को cutting-edge training के बाद तक बढ़ा दे, तो 6 साल गलत नहीं भी हो सकते
- लेकिन अगर 2026 या 2027 में demand फिर कमज़ोर पड़ती है, तो ठीक उसी समय impairment loss हो सकता है जब ऋणदाताओं को collateral value की ज़रूरत पड़े
एक ही GPU की तीन अलग-अलग कीमतें
- face value वह कीमत है जो SPV ने purchase price से borrower द्वारा चुने गए schedule के मुताबिक straight-line depreciation लागू करके books में दर्ज की है
- यही loan-to-value covenants और deal द्वारा संभाले जा सकने वाले debt के आकार को तय करती है
- liquidation value वह कीमत है जो distress situation में खरीदार चुकाता है
- सामान्य second-hand market में 2–3 साल इस्तेमाल हुए GPUs नई कीमत के 50–70% पर बिकते हैं
- अगर कई neoclouds एक साथ मुश्किल में आएँ, तो supply बढ़ने और buyers कम होने से forced-sale recovery face value के 30–50% तक गिर सकती है
- going-concern value वह कीमत है जब अगला lessee इसे एक सामान्य चल रहे asset की तरह इस्तेमाल कर सके, और यह पूरी तरह operational handover की सफलता पर निर्भर करती है
- जब ऋणदाता step-in rights का उपयोग करते हैं, तो उन्हें किसी दूसरे मालिक की colocation facility और उससे जुड़े contracts व constraints भी साथ लेने पड़ते हैं
- borrower की operation team चली जाए, तो credentials और topology knowledge भी गायब हो सकते हैं
- उन्हें ऐसे market का सामना करना पड़ता है जहाँ 18 महीनों में rent एक दिशा में 60% चला गया और फिर उल्टी दिशा में 40% उछला, वह भी बिना hedging tools के
- और उस माहौल में, जहाँ रोज़ लगभग 50 GPUs fail होते हैं, यह जानने वाले लोग भी चाहिए कि कौन-से racks लगातार unstable रहे हैं
- face value और going-concern value के बीच का अंतर मौजूदा वित्तीय संरचना में एक unhedged core risk बना हुआ है
वे निवेशक जो GPU-backed financing से बचते हैं
- KKR datacenter investment में सक्रिय है, लेकिन GPU-backed financing की बजाय इमारतों, power, cooling और land पर ध्यान देता है
- Global Infrastructure Partners के साथ मिलकर उसने 2022 में CyrusOne को $15 billion में खरीदा
- 2026 में Global Technical Realty में $1.5 billion निवेश किया
- फरवरी 2026 में STT GDC में 75% हिस्सेदारी $5.1 billion में हासिल की
- KKR का digital infrastructure, उसके $186 billion real assets business का अहम हिस्सा है, लेकिन वह Aligned Data Centers खरीदने वाले AIP consortium, xAI SPV, या CoreWeave debt facilities में शामिल नहीं है
- ये assets ऐसी foundational infrastructure layer हैं जो इस बात से परे मूल्य बनाए रखती हैं कि कौन-सी AI lab जीतेगी या कौन-सी GPU generation हावी रहेगी
- Peter Thiel ने 2025 की तीसरी तिमाही में अपनी NVIDIA holdings पूरी बेच दीं और Apple तथा Microsoft की ओर चले गए
GPU collateral market को किन बुनियादों की ज़रूरत है
- aircraft registries, appraisers और maintenance records बनने के बाद financeable asset बने, और ships ने भी BICA जैसी प्रणालियाँ विकसित कीं
- GPU-backed loans पर ऊँचा interest premium इसलिए है क्योंकि ऋणदाता दो बुनियादी सवालों के जवाब नहीं दे पाते
-
क्या cluster अभी भी सही से चल रहा है
- क्या यह 3 साल बाद भी सही से चलेगा
- GPU financing के mature होने के लिए सिर्फ़ hardware prices नहीं, बल्कि operational state, maintenance history, residual value, और future rents को मापने व transfer करने वाली प्रणालियों की भी ज़रूरत है
-
1 टिप्पणियां
Hacker News की राय
“सामान्य हालत में 2–3 साल इस्तेमाल किए गए GPU नए दाम के 50–70% पर बिकते हैं” वाला आंकड़ा अच्छी हालत वाले Nvidia H100 के लिए है, और इसमें मौजूदा supply shortage भी झलकती है।
यह कीमत हटाने के बाद सफाई, जांच और refurbish किए गए सामान की है, इसलिए बंद हो रही साइट से सीधे निकाले गए उपकरण की कीमत इससे कम होगी। eBay पर कई sellers पैक किए हुए नए सामान की एक जैसी तस्वीरें इस्तेमाल कर रहे हैं, या competitor के logo वाली तस्वीरें तक डाल रहे हैं, जो red flags लगते हैं।
https://introl.com/blog/secondary-gpu-markets-buying-selling...
https://www.ebay.com/shop/nvidia-h100-gpu?_nkw=nvidia+h100+g...
Dell R840 और 768GB RAM जैसे server बेचने वाली, हजारों reviews और 98.5% से ऊपर rating वाली company हो तो जोखिम काफी कम लगता है।
शायद Nvidia बड़े ग्राहकों के साथ Ferrari-style buyback agreements करे, ताकि upgrade का stock एक साथ market में आकर prices crash न कर दे और scarcity बनी रहे।
वरना उम्मीद है कि कुछ साल बाद open market में H100 मिल पाएंगे।
यह GPU-accelerated query engines, traditional machine learning, और GPU पर offload किए जा सकने वाले तरह-तरह के CPU workloads के लिए ideal होगा।
उस समय का H100 आज के used V100 जैसा होगा: बेहद खराब power efficiency, latest data formats और compute engines की कमी, अजीब adapters और कान फाड़ देने वाले server fans के बिना पिघल सकने वाला, और CUDA support भी बहुत पहले खत्म हो चुका होगा। अगर कोई दूसरा विकल्प बिल्कुल न हो तो अलग बात है, वरना यह लगभग बेकार हो सकता है।
अगर Huawei सस्ते accelerators market में उतार देता है, तो अमेरिकी AI कंपनियों को भी अपनी assets की असली value जल्द पता चल जाएगी; मुझे लगता है बचा समय करीब 6–9 महीने है।
गर्मियों में तपने वाले racks, firmware update के बाद unstable हो गए cooling circuits, failure के करीब nodes से jobs reroute करने जैसी सारी जानकारी monitoring system में होनी चाहिए।
तो कोई भी cutting-edge model थोड़े समय में situation समझ सकता है, इसलिए लगता है लेखक ने अपने हाथ में मौजूद systems से आए बदलाव को पर्याप्त रूप से नहीं समझा।
समझ नहीं आता कि यह समस्या GPU clusters के लिए ही खास क्यों है। आम तौर पर loan underwriters/insurers के पास collateral assets को operate और maintain करने की क्षमता नहीं होती, इसलिए houses, cars और equipment auctions में उनकी वास्तविक value से काफी कम में बिकते हैं, और lenders insurance लेते हैं।
मैंने देखा है कि एक बड़ी sawmill भारी loan न चुका पाने पर bank के कब्जे में चली गई। Bank business अपने ऊपर नहीं लेना चाहता था, लेकिन founder के हटने के बाद उसके पास विकल्प नहीं था। Kiln में पड़े finished lumber को भी कैसे handle करना है, यह उन्हें नहीं पता था, और पूरी sawmill infrastructure तो और भी कठिन थी। आखिर buyer न मिलने पर उन्होंने liquidation के लिए founder को consultant के तौर पर hire किया। जब्त किए गए datacenter के साथ भी यही प्रक्रिया होगी।
GPU value अपेक्षाकृत धीरे गिरती है, यह supply constraints का परिणाम है। अगर FP4 inference में Hopper और Rubin में freely चुन सकते, तो hardware मुफ्त में मिलकर सिर्फ बिजली का bill देना पड़े तब भी performance-per-watt की वजह से Hopper आकर्षक नहीं होता।
अभी Rubin तो दूर, Blackwell भी मिलना मुश्किल है इसलिए लोग H100 के लिए पैसे दे रहे हैं, लेकिन fab production capacity बढ़ने पर यह स्थिति टिकाऊ नहीं रहेगी।
और अजीब बात यह है कि massive hardware order backlog में है, और जो working equipment पहले ही allocate हो चुका है वह भी facilities पूरी होने का इंतजार करते हुए idle पड़ा है। Facility construction पहले ही सालों late है और related companies के बीच तरह-तरह के credit और debt swaps में उलझा है; यह simple bubble नहीं, बल्कि गुब्बारे पर खड़ा cards का tower जैसा है।
Cryptocurrency market से सीखा कि GPU की उम्र खत्म होने की मुख्य वजह सिर्फ failure नहीं होती। वजह यह होती है कि नए market conditions में ऐसे alternatives आ जाते हैं जो पुराने equipment की power efficiency को uneconomical बना देते हैं।
512GB Mac Studio eBay पर साल की शुरुआत के नए दाम से दोगुने में बिक रहा है।
अगर अच्छी नई car जितना पैसा खर्च करना है तो proper workstation बनाना बेहतर है। Apple TV के आकार का computer price-to-performance के लिए best हो ही नहीं सकता; शक है कि extra cash वाले aspiring vibe founders इसे आपस में overheat कर रहे हैं।
लेख GPU cluster को rocket science जैसा दिखाता है, लेकिन इसे power plant से बदल दें तो सवाल बिल्कुल नहीं बदलता। दोनों complex हैं, कई variables हैं और current output, regular maintenance, skilled staff आदि चाहिए।
आखिरकार आप खुद solve करेंगे या ऐसी company से contract करेंगे जो solve कर सके; और असल में ऐसे clusters को AI के लिए rent पर देने की कोशिश करने वाली companies काफी होंगी।
जल्द ही जब्त किए गए GPU market में बड़ी मात्रा में आने के पर्याप्त संकेत हैं। कुछ समय तक chaos रहेगा, लेकिन used GPU आसानी से मिलने लगें तो कई possibilities खुलेंगी।
Realistically, cryptocurrency mining farms फिर से तेजी से बढ़ सकते हैं और crypto prices घटा सकते हैं, लेकिन सस्ते GPU की bulk supply इसके अलावा और कौन से बदलाव संभव करेगी, यह देखना दिलचस्प होगा।