- OpenAI ने मॉडल, inference system और agent harness की efficiency में सुधार को कीमत और processing speed में दिखाते हुए enterprise AI की प्रति डॉलर performance बढ़ाई
- 30 जुलाई से Luna की कीमत 80% और Terra की 20% घटेगी; API में प्रति 10 लाख token पर Luna के लिए input $0.20·output $1.20, और Terra के लिए input $2·output $12 लागू होंगे
- Luna, एक साल पहले के frontier स्तर के मॉडल जैसी performance लगभग 6% लागत प्रति task और लगभग 9 गुना speed पर देता है; Agents’ Last Exam में इसने Fable 5 से बेहतर performance और अनुमानित task cost में लगभग 99% कमी दर्ज की
- GPT‑5.6 Sol का Fast mode मौजूदा Priority Processing की जगह लेता है और intelligence level बनाए रखते हुए Standard के मुकाबले अधिकतम 2.5 गुना speed 2 गुना कीमत पर देता है
- कंपनियां planning और uncertainty दूर करने के लिए Sol, और स्पष्ट implementation व testing के लिए Luna तैनात करके चरणवार evaluation के जरिए intelligence·speed·cost के संतुलन को समायोजित कर सकती हैं
Luna·Terra की कीमत में कटौती और Sol की speed में सुधार
- GPT‑5.6 की execution efficiency में सुधार से Luna·Terra की कीमत घटाई गई और Sol की API processing speed बेहतर हुई
- सबसे तेज़ और सस्ता मॉडल Luna 80%, और रोज़मर्रा के कामों के लिए balanced मॉडल Terra 20% सस्ता हुआ
- Codex और ChatGPT Work के paid subscription में भी इन दोनों मॉडलों का उपयोग कम credits में गिना जाएगा
- subscription price और allocation budget खुद नहीं बदलेंगे
- Luna tools का उपयोग करके कई चरणों वाले workflow पूरे कर सकता है, जिससे high-quality की जरूरत वाले बड़े पैमाने के tasks की operating cost घटती है
- Sol की कीमत में कोई बदलाव नहीं है
काम के नतीजों के हिसाब से मॉडल चुनना
- AI का कुशल उपयोग करने के लिए task की महत्ता·गलती की लागत·तात्कालिकता·पैमाने के अनुसार intelligence, speed, reliability और cost का संतुलन तय करना ज़रूरी है
- एक ही workflow में भी हर चरण का optimal point अलग हो सकता है
- Luna, एक साल पहले frontier स्तर के रहे मॉडल जैसी performance लगभग 6% लागत प्रति task और लगभग 9 गुना speed पर देता है
- specialized work को मापने वाले Agents’ Last Exam में इसने Fable 5 से बेहतर performance दिखाते हुए अनुमानित प्रति-task लागत में लगभग 99% की कमी की
- कंपनियां पहले आवश्यक result और quality standard तय कर सकती हैं, फिर evaluation के जरिए यह अलग कर सकती हैं कि कहाँ अतिरिक्त intelligence वास्तव में result बेहतर करती है और कहाँ कम लागत वाला processing उसी quality को बनाए रखता है
- coding workflow में Sol uncertainty दूर करने और planning बनाने का काम कर सकता है
- स्पष्ट रूप से परिभाषित बदलावों का implementation, test लिखना·चलाना, और result evaluation Luna संभाल सकता है
- GPT‑5.6 product family चरण-दर-चरण ज़रूरी intelligence लागू करने और पैदा होने वाले value के मुताबिक cost चुकाने के लिए अधिक विकल्प देती है
मॉडल से एजेंट तक फैले efficiency सुधार
- efficiency improvement model, model को चलाने वाले inference system, और tools व context को जोड़ने वाले agent harness — सभी स्तरों पर हुआ है
- GPT‑5.6 model tasks को अधिक direct path से process करता है
- बेहतर routing से hardware utilization बढ़ता है
- optimized production software tokens को अधिक efficiently generate करता है
- बेहतर context management agents को पूरा हो चुके काम दोबारा करने से रोकने में मदद करता है
- वही computing resources इस्तेमाल करके अधिक उपयोगी काम पूरे किए जा सकते हैं, जिससे प्रति result समय, token और cost घटती है
Sol द्वारा समर्थित अतिरिक्त optimization
- मानव-नेतृत्व वाली प्रक्रिया में GPT‑5.6 Sol ने production kernel को autonomously फिर से लिखा और optimize किया
- token generation सुधारने के लिए इसने सैकड़ों experiments design और execute किए, और training की निगरानी करते हुए समस्या आने पर हस्तक्षेप किया
- kernel काम से model serving की end-to-end cost में 20% की कमी आई, और experiments के जरिए token generation efficiency भी 15% से अधिक बेहतर हुई
- model की performance और autonomy बढ़ने के साथ अगला efficiency improvement खोजने की speed भी तेज़ होती है, जिससे feedback loop बनता है
- संबंधित engineering process को GPT‑5.6 efficiency improvement intro में देखा जा सकता है
scalability को सहारा देने वाली computing strategy
- intelligence की प्रचुर मांग पूरी करने के लिए सिर्फ़ अधिक computing resources ही नहीं, बल्कि उच्च-उत्पादक computing भी चाहिए
- OpenAI resilient infrastructure portfolio बना रहा है और हर workload को उसके execution के लिए सबसे उपयुक्त system पर रखता है
- Luna और Terra की कीमत में कटौती से बड़े पैमाने के tasks को अधिक scale पर आर्थिक रूप से चलाया जा सकता है
- Fast mode, response time महत्वपूर्ण होने वाले Sol tasks के लिए तेज़ API access देता है
- बड़े पैमाने की document analysis, customer interaction classification, और दोहराए जाने वाले implementation tasks को व्यापक रूप से चलाना अधिक किफायती हो जाता है
- जटिल Sol workloads को तब अधिक तेज़ी से process किया जा सकता है जब speed इतनी महत्वपूर्ण हो कि अतिरिक्त लागत जायज़ लगे
- अधिक शक्तिशाली models, technical teams के आगे के सुधारों को support करते हुए performance बढ़ाने और cost घटाने में लगने वाला समय कम करते हैं
Fast mode का काम और compatibility
- API का Fast mode Priority Processing की जगह लेता है और Codex के
/fastके अनुरूप है - GPT‑5.6 Sol में intelligence level बदले बिना Standard processing की तुलना में अधिकतम 2.5 गुना तेज़ speed 2 गुनी कीमत पर देता है
- backward compatibility बनाए रखते हुए मौजूदा
prioritytag वाले API requests भी चलते रहेंगे
उपलब्धता और API pricing
- GPT‑5.6 Terra और Luna ChatGPT Work, Codex, OpenAI API में उपलब्ध रहेंगे
- ChatGPT Work और Codex के Free·Go users Terra तक पहुंच सकते हैं
- Plus·Pro·Business·Enterprise users Terra और Luna दोनों चुन सकते हैं
- 30 जुलाई से API में प्रति 10 लाख token की कीमत इस प्रकार है
- Terra: input $2, output $12
- Luna: input $0.20, output $1.20
- ChatGPT और Codex की subscription pricing और allocation budget बने रहेंगे, लेकिन Terra और Luna के उपयोग पर खर्च होने वाले credits कम होंगे
- AWS में pricing change 30 जुलाई को देर से शुरू होकर क्रमिक रूप से लागू होगा
- पूरी pricing API price info में देखी जा सकती है
1 टिप्पणियां
Hacker News टिप्पणियाँ
John Wanamaker का कथन, “विज्ञापन खर्च का आधा हिस्सा बर्बाद होता है, लेकिन पता नहीं कौन-सा आधा,” model selection पर ज़्यादा फिट बैठता है। हम जानते हैं कि ज़्यादातर कामों के लिए शक्तिशाली model की ज़रूरत नहीं होती, लेकिन आसान और कठिन कामों में फर्क करना अपने-आप में हल करना मुश्किल, शायद undecidable समस्या है
HN को 1970s के hardware पर भी BBS की तरह चलाया जा सकता है, लेकिन असल में हम करीब 10 हज़ार transistors के बजाय लगभग 10 अरब transistors वाले CPU से लगभग वही काम कर रहे हैं और इस पर सोचते भी नहीं
“आज से सबसे तेज़ और सस्ते model GPT‑5.6 Luna की लागत 80% घटा रहे हैं” — यह सुनकर सच में शब्द नहीं बचते। लगा था कि हम कई महीनों में 5–10% सुधार वाले ठहराव के दौर में आ गए हैं, लेकिन ऐसा तेज़ बदलाव दिखने पर सवाल उठता है कि कीमत की तली आखिर कहाँ है
dynamic GPU clusters बाकी 5% और frontier को आगे बढ़ाने में इस्तेमाल होंगे, और वे काम भी नए सिरे से होने लगेंगे जो अभी ज़्यादातर knowledge workers के लिए बहुत कठिन होने के कारण किए ही नहीं जाते
अगर यह असली efficiency improvement है, तो aggressive quantization या KV cache compression जैसी चीज़ों के कारण quality खराब होने जैसी कीमत चुकानी पड़ सकती है
जैसे-जैसे tokens हर साल तेज़ और सस्ते होते जाएँगे, expert teams की नकल करने वाली AI factories और कहीं ज़्यादा parallelism reality बनेंगे
पहले से ही सस्ता और बढ़िया performance देने वाले Luna को 5x और सस्ता बना देना हैरान करता है। office में Sol और घर पर Luna इस्तेमाल करता हूँ; फर्क साफ़ है, लेकिन बहुत भारी नहीं। एक साल तक prices लगातार बढ़ते रहे, फिर Luna, Kimi K3, GLM 5.2 के साथ फिर गिरावट जैसा लग रहा है
OpenAI और Anthropic ने भी कई महीनों तक prices बढ़ाए, फिर एक अमेरिकी lab ने prices में भारी कटौती की, इसलिए यह उलटी दिशा जैसा लगता है
वे कहते हैं, “kernel work से model serving की end-to-end cost 20% घटाई, और experiments के ज़रिये token generation efficiency 15% से ज़्यादा बढ़ाई।” अगर GPT-5.6 serving cost 20% घटी है, तो क्या इसका मतलब हर महीने अरबों dollars की बचत है, यह जानना दिलचस्प है
SpaceX IPO documents के अनुसार Anthropic ने दो Colossus data centers की inference capacity lease करने पर $1.25 billion खर्च किए, लेकिन मौजूदा AWS वगैरह capacity को देखते हुए यह कुल का कितना हिस्सा है, पता नहीं। OpenAI की monthly inference cost भी शायद कई अरब dollars के स्तर की है, इसलिए 20% saving बहुत बड़ा बदलाव है
यह बदलाव dial-up से broadband में transition जैसा महसूस होता है। मैंने deep research के लिए Luna की पहले ही जोरदार recommendation की थी; अब उसी cost में 5x ज़्यादा run कर पाना जबरदस्त है
अभी भी hypothesis generation के लिए 10 agents parallel में चलाता हूँ; 50 की कल्पना करना भी मुश्किल है। अगर एक ही prompt और model को दर्जनों बार चलाने पर cost burden कम हो, तो statistics कहीं ज़्यादा दिलचस्प और powerful हो जाते हैं
Luna की नई pricing unexpected है, और इस price/performance से compete करने वाला product market में दिखता नहीं
production apps के लिए अब OpenAI साफ़ तौर पर best provider है। API stable है, features rich हैं, और models across the board बढ़िया price/performance देते हैं। लंबे समय तक Fireworks पर Kimi K2.5 जैसे open-weight models इस्तेमाल किए, लेकिन intermittent issues थे; Anthropic और Google के साथ भी ऐसा ही था। OpenAI तेज़ है और लगभग हर intelligence level पर बेहतर price/performance दिखाता है
आमतौर पर OpenRouter का price/performance graph देखता हूँ और दाईं तरफ
"Show Pareto"enable करता हूँ। personal projects में अब तक GLM-5.2 इस्तेमाल करता था, लेकिन अब Luna आसान choice बन गया हैLuna का 80% price cut बहुत aggressive है। जिन ज़्यादातर tasks में frontier intelligence नहीं चाहिए, उनमें यह overwhelmingly अच्छा choice है, और कभी-कभी Luna Opus 5 से भी टक्कर लेता है
xhighऔर Luna केmaxके बीच साफ़ फर्क था। Sol prompt को बेहतर समझता है, और Luna को ज़्यादा specific और clear instructions देने पड़ते हैंमैंने DeepSeek v4 flash tokens काफी prepay किए हैं, और वे खत्म होने के बाद कुछ समय के लिए Luna tokens खरीदकर देखना चाहता हूँ। मुझे सस्ते और तेज़ models पसंद हैं और मैं retired हूँ, इसलिए कभी-कभी ज़्यादा strong model पर manually switch करने में समय लगे तो भी ठीक है
Luna का 80% सस्ता होना हैरान करता है। compute cost लगातार गिर रही है, इसलिए अगले साल powerful models के API usage fees subscription fees से सस्ते हो सकते हैं