- Kimi K3 की मांग उम्मीद से कहीं ज़्यादा बढ़ गई है, और पिछले 48 घंटों में GPU उपयोग मौजूदा क्षमता सीमा के करीब पहुँच गया है
- मौजूदा subscribers के उपयोग अनुभव की सुरक्षा के लिए नए subscription अस्थायी रूप से रोक दिए गए हैं और वर्तमान सदस्यों को computing resources प्राथमिकता से आवंटित किए जा रहे हैं
- मौजूदा paid subscribers प्रभावित नहीं होंगे, और Moonshot AI infrastructure capacity बढ़ाने की प्रक्रिया तेज़ कर रहा है
- अतिरिक्त क्षमता उपलब्ध होते ही नए subscription बैचों में फिर से शुरू किए जाएंगे
- साथ ही, उपयोग के उद्देश्य के अनुसार membership को दो समर्पित plans में बांटा जाएगा
- Kimi Membership: Kimi Web, App, Work के लिए
- Kimi Code Membership: coding workflow के लिए
- यह कदम सेवा-वार मांग के अनुसार computing resources को अधिक सटीक रूप से आवंटित करने और स्थिर उपयोग अनुभव बनाए रखने के लिए उठाया गया है
1 टिप्पणियां
Hacker News की राय
पिछले 48 घंटों में मांग मौजूदा क्षमता की सीमा के करीब पहुंचने पर, मौजूदा subscribers का उपयोग अनुभव सुरक्षित रखने के लिए नए subscriptions को अस्थायी रूप से रोकने और compute resources को मौजूदा members को प्राथमिकता से आवंटित करने वाला बयान सचमुच अच्छा लगा
यह कंपनी तेज़ growth से ज़्यादा मौजूदा customer satisfaction को प्राथमिकता देती है
कल Claude usage खत्म हो गया था, इसलिए Kimi test करने के लिए 20 डॉलर plan लिया। Kimi Code में K3 चुना और repository में hardware, input/output, thread control, network से जुड़ी input settings सब खोजकर report बनाने को कहा, लेकिन 12 मिनट सोचने के बाद उसने जवाब दिया कि daily quota पूरा खर्च हो गया है
अगले दिन Fable ने वही काम 3 मिनट में कर दिया, इसलिए K3 इस्तेमाल करना हो तो 20 डॉलर plan न खरीदना बेहतर है
web screen पर weekly usage भी 23% खर्च हो गया, जबकि 20 डॉलर/month Cursor में इससे कहीं ज़्यादा काम करने पर भी कभी warning तक नहीं मिली। पहले लगा OpenCode की समस्या है, लेकिन अगर Kimi Code में भी ऐसा था तो शायद ऐसा नहीं है
Kimi में full attention layers की तुलना में RNN/linear attention layers 3 गुना ज़्यादा हैं, यह खास तौर पर दिलचस्प है। अभी इस्तेमाल नहीं किया है, लेकिन long-context tasks के लिए यह architecture बहुत reasonable लगता है
parameters ज़्यादा होने की वजह शायद वही है जो compute-optimized xLSTM में parameters ज़्यादा होने की वजह है, और इस model की सफलता देखकर अफसोस होता है कि Europe में कोई विशाल xLSTM-family model विकसित नहीं हो पाया। यह एक practical team है जो internal evals में अच्छा काम करने वाली चीज़ चुनती है, इसलिए उन्होंने normal attention layers भी रखीं, और implementation तक ideal है इसकी guarantee नहीं दी जा सकती, लेकिन Kimi दिखाता है कि अगर large-scale LLM training के लिए supercomputer सही researchers को दिया जाता तो क्या संभव था। आखिरकार यह ज़्यादातर Hochreiter का क्षेत्र, यानी RNN ही है
लगभग 6 महीनों से coding tasks के लिए Kimi इस्तेमाल कर रहा हूं और संतुष्ट हूं, इसलिए दूसरे models पर वापस नहीं देखा। बस कभी-कभी Claude से वही task test कर लेता हूं कि कहीं कुछ miss तो नहीं हो रहा
OpenRouter इस्तेमाल करता हूं और LLM usage का scope narrow है, इसलिए cost difference किसी भी तरफ negligible है
Google की तरह चुपचाप limits कम करने के बजाय, इस उम्मीद में कि users subscription value घटने पर ध्यान नहीं देंगे, नए subscriptions रोकना refreshing है
Gemini Apps साफ लिखता है कि capacity constraints या activity spikes के समय quality बनाए रखने के लिए बिना notice limits बदल सकता है: https://support.google.com/gemini/answer/16275805
multi-agent game coding evals में Chinese models आम तौर पर single-shot reasoning में कमजोर होते हैं, लेकिन tool use और iterative improvement से इसकी भरपाई करते हैं। Kimi K3 भी single-shot coding में 19वें नंबर पर है, लेकिन execution environment और tools देकर कई बार call करने वाले agentic coding में 3वें नंबर पर था, और average submissions के आधार पर सिर्फ Sol और Fable आगे थे
software engineers के लिए agentic coding सबसे relevant है, लेकिन speed भी important है, और अभी Kimi में यह real usability issue बनता है। Fireworks जैसे external inference providers ने previous models में यह gap कम किया है। open-weight frontier models का standard बनना दिलचस्प trend है, और सिर्फ frontier model own करके compete करना धीरे-धीरे मुश्किल होता जाएगा
data: https://gertlabs.com/rankings?mode=agentic_coding
इस model की quality उम्मीद से बेहतर है और खासकर code reviews और PR reviews में अच्छा है। हालांकि बहुत ज़्यादा demand और बड़े model size की वजह से अभी यह बहुत slow है, इसलिए relatively simple code review में भी बहुत लंबा समय लगता है
सोच रहा हूं कि Kimi की यह लहर abundant supply से अधिक consumption को जन्म देने वाले Jevons paradox के तहत net increase है या बस लोग सस्ते model की ओर shift हुए हैं
यह भी जानना चाहूंगा कि अलग-अलग labs और OpenRouter को मिलाकर total token consumption देखने के लिए कोई अच्छा source है या नहीं
सोच रहा हूं कि Anthropic और OpenAI क्या कुछ समय तक सिर्फ इसलिए competitive बने रहेंगे कि वे ही इस level की demand संभाल सकने वाले providers हैं। Costs पहले ही बड़े हैं, और outages से employees का time waste हो तो enterprise customers इसे पसंद नहीं करेंगे
लगता है subscription इसलिए रोका गया क्योंकि उन्होंने आंका कि customers को minimum service quality guarantee नहीं कर पाएंगे