GPT-4.5, व्यावसायिक जीवन 4.5 महीने

  • फ़रवरी 2025 में लॉन्च हुआ उस समय का सबसे महंगा मॉडल GPT-4.5 (input $75/output $150 per 1M tokens) 5 महीने पूरे होने से पहले ही API से हटा दिया गया। यह OpenAI के इतिहास का सबसे कम उम्र वाला मॉडल था, और इसके ऊपर प्रोडक्ट बनाने वाले डेवलपर्स migration cycle में फंस गए
  • बाज़ार ने इससे जो सबक निकाला वह था: "किसी और के मॉडल के ऊपर अपना बिज़नेस मत बनाओ"; लेकिन इस लेख का विषय यह है कि यह सबक केवल आधा सही है

मॉडल लेयर commodity बन रही है

  • SWE-bench Verified के आधार पर शीर्ष 5 मॉडल 0.4 अंक के भीतर सिमटे हुए हैं, जबकि कीमत में 5 गुना अंतर है। पूरे बाज़ार में सबसे सस्ते token और premium inference token के बीच 600 गुना से अधिक का अंतर है — कीमत अब performance का proxy नहीं रही
  • open-weight और closed frontier के बीच का अंतर सार्वजनिक benchmark के आधार पर औसतन 4 महीने (private benchmark में 8~10 महीने) के स्तर पर 18 महीने से अधिक समय से स्थिर है। अंतर वास्तविक है, लेकिन संकीर्ण, अनुमान योग्य, और बढ़ता नहीं है

frontier API पर निर्भरता के 4 जोखिम

  • कीमत में उतार-चढ़ाव: Claude 3.5 Haiku की कीमत 4 गुना बढ़ी और एक महीने बाद आंशिक रूप से वापस ली गई, o3 की कीमत एक ही दिन में 80% घट गई। नया tokenizer उसी टेक्स्ट से 35% तक अधिक tokens भी बना सकता है — समस्या बढ़ोतरी या कटौती की दिशा नहीं, बल्कि variance है
  • deprecation cycle: फ़रवरी 2026 में GPT-4o, 4.1, o4-mini को लगभग 3 महीने की सूचना देकर एक साथ बंद किया गया। एक साल तक तराशे गए prompts नए मॉडल में अलग तरह से काम करते हैं, इसके लिए "prompt drift" जैसा शब्द भी चलन में आया
  • platform absorption: GPT wrapper की वह कमजोरी, जिसमें provider वही फीचर अपने प्रोडक्ट में जोड़ देता है जो wrapper दे रहा था
  • regulation: जून 2026 में Anthropic Fable 5 अमेरिकी export control guidelines के कारण 19 दिनों तक दुनिया भर में एक साथ रोक दिया गया — ऐसा variable जिसे provider भी चुन नहीं सकता

ये चारों जोखिम एक ही समस्या से निकलते हैं — किसी और के hosted frontier पर निर्भरता

  • open source को खुद चलाने से price volatility, deprecation, regulatory shutdown समाप्त हो जाते हैं और platform absorption का असर कम होता है। एक बार मिले हुए weights न तो deprecate होते हैं, न वापस लिए जाते हैं
  • लागत को ईमानदारी से देखें: consumer GPU पर self-hosting करने पर लगभग $1 per million tokens (3 साल की depreciation + बिजली, 30% utilization) पड़ता है, जो सबसे सस्ते open-weight API ($0.14/$0.28) से महंगा है, इसलिए absolute cost में यह हारता है
  • self-hosting की अर्थव्यवस्था औसत में नहीं, variance में है। ऊपर से, सबसे सस्ता API input data को training के लिए सहेज कर रखता है — सबसे सस्ती कीमत की छिपी हुई लागत आपका data है

एक ही diagnosis, उल्टा prescription

  • Big Tech के पैमाने पर frontier API पर निर्भर content business कमज़ोर है — यह diagnosis सही है
  • लेकिन छोटे खिलाड़ी अगर good-enough क्षेत्र में open source को खुद चलाते हैं, तो वे उसी निर्भरता को काट देते हैं जो कमज़ोरी पैदा करती है — Big Tech का diagnosis ज्यों का त्यों छोटे startup पर कॉपी करते ही निष्कर्ष गलत हो जाता है

यह मुफ़्त नहीं है (4 brakes)

  • commodity input से commodity output बनता है — moat केवल AI से orthogonal चीज़ों से आता है: distribution, proprietary data, domain integration, verification और judgment
  • good-enough की रेखा ऊपर खिसकती रहती है — अगर आप बस उसी रेखा पर खड़े रह गए, तो आप margin गिरने वाले क्षेत्र में खड़े हैं
  • सीमा domain नहीं, task difficulty है: NIST evaluation में शीर्ष open-weight मॉडल गणित में frontier के लगभग बराबर था, लेकिन cyber, abstract reasoning, और long-horizon agentic coding में 30 से अधिक अंकों से पीछे था
  • self-hosting सीधे operations, tuning, validation capability और compliance responsibility की मांग करता है — निर्भरता खत्म नहीं हुई, बस API provider से आपकी अपनी capability पर शिफ्ट हो गई

निष्कर्ष: असली मुकाबला verification और judgment में है

  • वही open model इस्तेमाल करने पर भी अगर output को ज्यों का त्यों बाहर भेज दिया जाए तो वह demo है; यदि facts, numbers और identification को validation layer के पीछे रखा जाए, तो वह product है
  • AI Content में असली मुकाबला सस्ते मॉडल को भरोसेमंद product में बदलने वाले engineering judgment का है, और open source उसी judgment वाले लोगों के हाथ में हथियार बनता है

यह लेख स्वयं लिखा गया है। local deployment और API के बीच stack design पर विचारों का स्वागत है।

अभी कोई टिप्पणी नहीं है.

अभी कोई टिप्पणी नहीं है.