1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • OpenAI ने मॉडल, inference system और agent harness की efficiency में सुधार को कीमत और processing speed में दिखाते हुए enterprise AI की प्रति डॉलर performance बढ़ाई
  • 30 जुलाई से Luna की कीमत 80% और Terra की 20% घटेगी; API में प्रति 10 लाख token पर Luna के लिए input $0.20·output $1.20, और Terra के लिए input $2·output $12 लागू होंगे
  • Luna, एक साल पहले के frontier स्तर के मॉडल जैसी performance लगभग 6% लागत प्रति task और लगभग 9 गुना speed पर देता है; Agents’ Last Exam में इसने Fable 5 से बेहतर performance और अनुमानित task cost में लगभग 99% कमी दर्ज की
  • GPT‑5.6 Sol का Fast mode मौजूदा Priority Processing की जगह लेता है और intelligence level बनाए रखते हुए Standard के मुकाबले अधिकतम 2.5 गुना speed 2 गुना कीमत पर देता है
  • कंपनियां planning और uncertainty दूर करने के लिए Sol, और स्पष्ट implementation व testing के लिए Luna तैनात करके चरणवार evaluation के जरिए intelligence·speed·cost के संतुलन को समायोजित कर सकती हैं

Luna·Terra की कीमत में कटौती और Sol की speed में सुधार

  • GPT‑5.6 की execution efficiency में सुधार से Luna·Terra की कीमत घटाई गई और Sol की API processing speed बेहतर हुई
  • सबसे तेज़ और सस्ता मॉडल Luna 80%, और रोज़मर्रा के कामों के लिए balanced मॉडल Terra 20% सस्ता हुआ
    • Codex और ChatGPT Work के paid subscription में भी इन दोनों मॉडलों का उपयोग कम credits में गिना जाएगा
    • subscription price और allocation budget खुद नहीं बदलेंगे
  • Luna tools का उपयोग करके कई चरणों वाले workflow पूरे कर सकता है, जिससे high-quality की जरूरत वाले बड़े पैमाने के tasks की operating cost घटती है
  • Sol की कीमत में कोई बदलाव नहीं है

काम के नतीजों के हिसाब से मॉडल चुनना

  • AI का कुशल उपयोग करने के लिए task की महत्ता·गलती की लागत·तात्कालिकता·पैमाने के अनुसार intelligence, speed, reliability और cost का संतुलन तय करना ज़रूरी है
    • एक ही workflow में भी हर चरण का optimal point अलग हो सकता है
  • Luna, एक साल पहले frontier स्तर के रहे मॉडल जैसी performance लगभग 6% लागत प्रति task और लगभग 9 गुना speed पर देता है
  • specialized work को मापने वाले Agents’ Last Exam में इसने Fable 5 से बेहतर performance दिखाते हुए अनुमानित प्रति-task लागत में लगभग 99% की कमी की
  • कंपनियां पहले आवश्यक result और quality standard तय कर सकती हैं, फिर evaluation के जरिए यह अलग कर सकती हैं कि कहाँ अतिरिक्त intelligence वास्तव में result बेहतर करती है और कहाँ कम लागत वाला processing उसी quality को बनाए रखता है
    • coding workflow में Sol uncertainty दूर करने और planning बनाने का काम कर सकता है
    • स्पष्ट रूप से परिभाषित बदलावों का implementation, test लिखना·चलाना, और result evaluation Luna संभाल सकता है
  • GPT‑5.6 product family चरण-दर-चरण ज़रूरी intelligence लागू करने और पैदा होने वाले value के मुताबिक cost चुकाने के लिए अधिक विकल्प देती है

मॉडल से एजेंट तक फैले efficiency सुधार

  • efficiency improvement model, model को चलाने वाले inference system, और tools व context को जोड़ने वाले agent harness — सभी स्तरों पर हुआ है
    • GPT‑5.6 model tasks को अधिक direct path से process करता है
    • बेहतर routing से hardware utilization बढ़ता है
    • optimized production software tokens को अधिक efficiently generate करता है
    • बेहतर context management agents को पूरा हो चुके काम दोबारा करने से रोकने में मदद करता है
  • वही computing resources इस्तेमाल करके अधिक उपयोगी काम पूरे किए जा सकते हैं, जिससे प्रति result समय, token और cost घटती है

Sol द्वारा समर्थित अतिरिक्त optimization

  • मानव-नेतृत्व वाली प्रक्रिया में GPT‑5.6 Sol ने production kernel को autonomously फिर से लिखा और optimize किया
  • token generation सुधारने के लिए इसने सैकड़ों experiments design और execute किए, और training की निगरानी करते हुए समस्या आने पर हस्तक्षेप किया
  • kernel काम से model serving की end-to-end cost में 20% की कमी आई, और experiments के जरिए token generation efficiency भी 15% से अधिक बेहतर हुई
  • model की performance और autonomy बढ़ने के साथ अगला efficiency improvement खोजने की speed भी तेज़ होती है, जिससे feedback loop बनता है
  • संबंधित engineering process को GPT‑5.6 efficiency improvement intro में देखा जा सकता है

scalability को सहारा देने वाली computing strategy

  • intelligence की प्रचुर मांग पूरी करने के लिए सिर्फ़ अधिक computing resources ही नहीं, बल्कि उच्च-उत्पादक computing भी चाहिए
  • OpenAI resilient infrastructure portfolio बना रहा है और हर workload को उसके execution के लिए सबसे उपयुक्त system पर रखता है
    • Luna और Terra की कीमत में कटौती से बड़े पैमाने के tasks को अधिक scale पर आर्थिक रूप से चलाया जा सकता है
    • Fast mode, response time महत्वपूर्ण होने वाले Sol tasks के लिए तेज़ API access देता है
  • बड़े पैमाने की document analysis, customer interaction classification, और दोहराए जाने वाले implementation tasks को व्यापक रूप से चलाना अधिक किफायती हो जाता है
  • जटिल Sol workloads को तब अधिक तेज़ी से process किया जा सकता है जब speed इतनी महत्वपूर्ण हो कि अतिरिक्त लागत जायज़ लगे
  • अधिक शक्तिशाली models, technical teams के आगे के सुधारों को support करते हुए performance बढ़ाने और cost घटाने में लगने वाला समय कम करते हैं

Fast mode का काम और compatibility

  • API का Fast mode Priority Processing की जगह लेता है और Codex के /fast के अनुरूप है
  • GPT‑5.6 Sol में intelligence level बदले बिना Standard processing की तुलना में अधिकतम 2.5 गुना तेज़ speed 2 गुनी कीमत पर देता है
  • backward compatibility बनाए रखते हुए मौजूदा priority tag वाले API requests भी चलते रहेंगे

उपलब्धता और API pricing

  • GPT‑5.6 Terra और Luna ChatGPT Work, Codex, OpenAI API में उपलब्ध रहेंगे
    • ChatGPT Work और Codex के Free·Go users Terra तक पहुंच सकते हैं
    • Plus·Pro·Business·Enterprise users Terra और Luna दोनों चुन सकते हैं
  • 30 जुलाई से API में प्रति 10 लाख token की कीमत इस प्रकार है
    • Terra: input $2, output $12
    • Luna: input $0.20, output $1.20
  • ChatGPT और Codex की subscription pricing और allocation budget बने रहेंगे, लेकिन Terra और Luna के उपयोग पर खर्च होने वाले credits कम होंगे
  • AWS में pricing change 30 जुलाई को देर से शुरू होकर क्रमिक रूप से लागू होगा
  • पूरी pricing API price info में देखी जा सकती है

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News टिप्पणियाँ
  • John Wanamaker का कथन, “विज्ञापन खर्च का आधा हिस्सा बर्बाद होता है, लेकिन पता नहीं कौन-सा आधा,” model selection पर ज़्यादा फिट बैठता है। हम जानते हैं कि ज़्यादातर कामों के लिए शक्तिशाली model की ज़रूरत नहीं होती, लेकिन आसान और कठिन कामों में फर्क करना अपने-आप में हल करना मुश्किल, शायद undecidable समस्या है

    • इतना मुश्किल नहीं है। पहले बस halting problem को ठीक-ठाक हल करने वाली कोई library ढूँढ लीजिए, फिर तुरंत शुरू कर सकते हैं
    • हम अभी एक साथ 1,000 agents चलाने के चरण तक नहीं पहुँचे हैं। फिलहाल agent जो अहम काम करता है, उसे खुद ध्यान देकर manage करते हैं, इसलिए cutting-edge से नीचे का model चुनने की कोई खास वजह नहीं है। coding के अलावा कामों में यह अलग हो सकता है
    • अगर agent और user हों, तो evals चलाकर model की सीमाएँ देखी जा सकती हैं। Luna tool calling में सबसे बेहतरीन नहीं है, लेकिन अगर problem और tools साफ़ तौर पर define किए जाएँ, तो बहुत कम लागत पर Gemini 4 Flash के बराबर आ सकती है
    • https://news.ycombinator.com/item?id=49113236 वाला नजरिया सही बैठता है
      HN को 1970s के hardware पर भी BBS की तरह चलाया जा सकता है, लेकिन असल में हम करीब 10 हज़ार transistors के बजाय लगभग 10 अरब transistors वाले CPU से लगभग वही काम कर रहे हैं और इस पर सोचते भी नहीं
  • “आज से सबसे तेज़ और सस्ते model GPT‑5.6 Luna की लागत 80% घटा रहे हैं” — यह सुनकर सच में शब्द नहीं बचते। लगा था कि हम कई महीनों में 5–10% सुधार वाले ठहराव के दौर में आ गए हैं, लेकिन ऐसा तेज़ बदलाव दिखने पर सवाल उठता है कि कीमत की तली आखिर कहाँ है

    • जब model intelligence मौजूदा knowledge work का 90–95% भरोसेमंद ढंग से संभालने लगेगी, तो weights को silicon में etched करके price/performance फिर 10x सुधर जाएगा
      dynamic GPU clusters बाकी 5% और frontier को आगे बढ़ाने में इस्तेमाल होंगे, और वे काम भी नए सिरे से होने लगेंगे जो अभी ज़्यादातर knowledge workers के लिए बहुत कठिन होने के कारण किए ही नहीं जाते
    • मौजूदा कीमत में असली लागत कितनी है और investor subsidy के ज़रिये market capture strategy कितनी, यह पता नहीं। अगर OpenAI को अपनी funding power पर भरोसा है, तो यह flagship product रखने वाली Anthropic पर दबाव डालने की कोशिश भी हो सकती है
    • यकीन करना मुश्किल है, लेकिन आंकड़े बेहद प्रभावशाली हैं। performance कुछ प्रतिशत कम भी हो, फिर भी अगर यह competitors से 80% से ज़्यादा सस्ता है और कोई अमेरिकी कंपनी इसे अमेरिकी hyperscale cloud पर दे रही है, तो ज़्यादातर कंपनियों के लिए कोई और विकल्प justify करना मुश्किल होगा
    • इसका मतलब cost 80% घटी है, efficiency 80% सुधरी है ऐसा नहीं। Luna शुरू से ही महँगा रहा हो सकता है, और model के बारे में जानकारी भी कम है
      अगर यह असली efficiency improvement है, तो aggressive quantization या KV cache compression जैसी चीज़ों के कारण quality खराब होने जैसी कीमत चुकानी पड़ सकती है
    • हर कुछ महीनों में 5–10% सुधार भी काफी हैरान करने वाला है। सोचता हूँ Kimi 3 Anthropic, OpenAI और Google के अंदर कितना दबाव बना रहा होगा
      जैसे-जैसे tokens हर साल तेज़ और सस्ते होते जाएँगे, expert teams की नकल करने वाली AI factories और कहीं ज़्यादा parallelism reality बनेंगे
  • पहले से ही सस्ता और बढ़िया performance देने वाले Luna को 5x और सस्ता बना देना हैरान करता है। office में Sol और घर पर Luna इस्तेमाल करता हूँ; फर्क साफ़ है, लेकिन बहुत भारी नहीं। एक साल तक prices लगातार बढ़ते रहे, फिर Luna, Kimi K3, GLM 5.2 के साथ फिर गिरावट जैसा लग रहा है

    • इसे Kimi या GLM वाली ही दिशा कहना मुश्किल है। GLM 5.2 चीनी models के हिसाब से बड़ा price hike था और Kimi K3 उससे भी ऊपर गया, OpenAI pricing के करीब
      OpenAI और Anthropic ने भी कई महीनों तक prices बढ़ाए, फिर एक अमेरिकी lab ने prices में भारी कटौती की, इसलिए यह उलटी दिशा जैसा लगता है
    • कंपनियाँ market कब्जाने के लिए दिन-रात competition कर रही हैं, इसलिए आखिरकार यह बस समय की बात है
    • Kimi सच में सस्ता है या नहीं, इस पर शक है; बल्कि यह काफी महँगा model है
    • bug fix जैसे काम, जहाँ result verify किया जा सकता है, उनमें उचित verification process लिख दी जाए तो कोई भी model काम आ सकता है
  • वे कहते हैं, “kernel work से model serving की end-to-end cost 20% घटाई, और experiments के ज़रिये token generation efficiency 15% से ज़्यादा बढ़ाई।” अगर GPT-5.6 serving cost 20% घटी है, तो क्या इसका मतलब हर महीने अरबों dollars की बचत है, यह जानना दिलचस्प है
    SpaceX IPO documents के अनुसार Anthropic ने दो Colossus data centers की inference capacity lease करने पर $1.25 billion खर्च किए, लेकिन मौजूदा AWS वगैरह capacity को देखते हुए यह कुल का कितना हिस्सा है, पता नहीं। OpenAI की monthly inference cost भी शायद कई अरब dollars के स्तर की है, इसलिए 20% saving बहुत बड़ा बदलाव है

    • करीब 2 साल पहले Gemini 2.5 ने अपने kernel improvements में मदद करके मुश्किल से efficiency में 1% सुधार तक पहुँचाया था, अब यह 20% तक आ गया है
    • कल्पना कीजिए resume में लिख सकें: “inference cost 20% घटाई, जिससे company ने हर महीने अरबों dollars बचाए
  • यह बदलाव dial-up से broadband में transition जैसा महसूस होता है। मैंने deep research के लिए Luna की पहले ही जोरदार recommendation की थी; अब उसी cost में 5x ज़्यादा run कर पाना जबरदस्त है
    अभी भी hypothesis generation के लिए 10 agents parallel में चलाता हूँ; 50 की कल्पना करना भी मुश्किल है। अगर एक ही prompt और model को दर्जनों बार चलाने पर cost burden कम हो, तो statistics कहीं ज़्यादा दिलचस्प और powerful हो जाते हैं

    • ‘deep research’ आप具体 रूप से कैसे run करते हैं, जानना चाहूँगा
    • hypothesis generation और research process के बारे में और जानना चाहता हूँ। अच्छे ideas के लिए reasoning ability ज़्यादा चाहिए मानकर Sol इस्तेमाल किया था, लेकिन एक point के बाद quality से ज़्यादा quantity बेहतर हो सकती है
    • किन tasks में agents की संख्या बढ़ाने से फायदा होता है और किनमें नहीं, यह जानना दिलचस्प है
  • Luna की नई pricing unexpected है, और इस price/performance से compete करने वाला product market में दिखता नहीं
    production apps के लिए अब OpenAI साफ़ तौर पर best provider है। API stable है, features rich हैं, और models across the board बढ़िया price/performance देते हैं। लंबे समय तक Fireworks पर Kimi K2.5 जैसे open-weight models इस्तेमाल किए, लेकिन intermittent issues थे; Anthropic और Google के साथ भी ऐसा ही था। OpenAI तेज़ है और लगभग हर intelligence level पर बेहतर price/performance दिखाता है

    • OpenAI API बहुत stable है; आखिरी outage या downtime कब था, याद भी नहीं
  • आमतौर पर OpenRouter का price/performance graph देखता हूँ और दाईं तरफ "Show Pareto" enable करता हूँ। personal projects में अब तक GLM-5.2 इस्तेमाल करता था, लेकिन अब Luna आसान choice बन गया है

    • सोचता हूँ क्या OpenRouter ने launch से ही Luna और Terra पर 50% discount नहीं दिया था। इस cut के बाद वह discount क्या होगा, पता नहीं
    • official docs के हिसाब से Luna पुराने Nano model family के करीब है; coding performance भी वाकई अच्छी है या नहीं, यह जानना चाहता हूँ
  • Luna का 80% price cut बहुत aggressive है। जिन ज़्यादातर tasks में frontier intelligence नहीं चाहिए, उनमें यह overwhelmingly अच्छा choice है, और कभी-कभी Luna Opus 5 से भी टक्कर लेता है

    • Luna को Haiku से compete करने के लिए बनाया गया model है; किन tasks में यह Opus के बराबर है, जानना चाहूँगा
    • Sol के xhigh और Luna के max के बीच साफ़ फर्क था। Sol prompt को बेहतर समझता है, और Luna को ज़्यादा specific और clear instructions देने पड़ते हैं
  • मैंने DeepSeek v4 flash tokens काफी prepay किए हैं, और वे खत्म होने के बाद कुछ समय के लिए Luna tokens खरीदकर देखना चाहता हूँ। मुझे सस्ते और तेज़ models पसंद हैं और मैं retired हूँ, इसलिए कभी-कभी ज़्यादा strong model पर manually switch करने में समय लगे तो भी ठीक है

  • Luna का 80% सस्ता होना हैरान करता है। compute cost लगातार गिर रही है, इसलिए अगले साल powerful models के API usage fees subscription fees से सस्ते हो सकते हैं

    • subscription users को लगातार बांधे रखता है और companies के लिए बहुत value देता है, इसलिए API subscription से सस्ता नहीं होगा