1 पॉइंट द्वारा GN⁺ 19 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Kimi K3 की मांग उम्मीद से कहीं ज़्यादा बढ़ गई है, और पिछले 48 घंटों में GPU उपयोग मौजूदा क्षमता सीमा के करीब पहुँच गया है
  • मौजूदा subscribers के उपयोग अनुभव की सुरक्षा के लिए नए subscription अस्थायी रूप से रोक दिए गए हैं और वर्तमान सदस्यों को computing resources प्राथमिकता से आवंटित किए जा रहे हैं
  • मौजूदा paid subscribers प्रभावित नहीं होंगे, और Moonshot AI infrastructure capacity बढ़ाने की प्रक्रिया तेज़ कर रहा है
  • अतिरिक्त क्षमता उपलब्ध होते ही नए subscription बैचों में फिर से शुरू किए जाएंगे
  • साथ ही, उपयोग के उद्देश्य के अनुसार membership को दो समर्पित plans में बांटा जाएगा
    • Kimi Membership: Kimi Web, App, Work के लिए
    • Kimi Code Membership: coding workflow के लिए
  • यह कदम सेवा-वार मांग के अनुसार computing resources को अधिक सटीक रूप से आवंटित करने और स्थिर उपयोग अनुभव बनाए रखने के लिए उठाया गया है

1 टिप्पणियां

 
Hacker News की राय
  • पिछले 48 घंटों में मांग मौजूदा क्षमता की सीमा के करीब पहुंचने पर, मौजूदा subscribers का उपयोग अनुभव सुरक्षित रखने के लिए नए subscriptions को अस्थायी रूप से रोकने और compute resources को मौजूदा members को प्राथमिकता से आवंटित करने वाला बयान सचमुच अच्छा लगा
    यह कंपनी तेज़ growth से ज़्यादा मौजूदा customer satisfaction को प्राथमिकता देती है

    • जब GitHub ने पहले बिल्कुल यही किया था, तो बहुत लोग नाराज़ हुए थे, लेकिन तब भी और अब भी यह सही फैसला था
    • मुझे हमेशा यह बात नापसंद रही कि किसी भी website पर “Login” button “Sign Up” से छोटा होता है
    • तो क्या Hetzner को भी demand और supply को balance करने के लिए कीमतें बढ़ाने के बजाय नई sign-ups रोक देनी चाहिए थीं?
    • बहुत उत्साहित होने की ज़रूरत नहीं है। Venture capital firms AI में भारी पैसा डाल रही हैं, इसलिए हो सकता है OpenAI या Anthropic datasets distill करने के लिए token खपत वाली मशीन को fund कर रहे हों
  • कल Claude usage खत्म हो गया था, इसलिए Kimi test करने के लिए 20 डॉलर plan लिया। Kimi Code में K3 चुना और repository में hardware, input/output, thread control, network से जुड़ी input settings सब खोजकर report बनाने को कहा, लेकिन 12 मिनट सोचने के बाद उसने जवाब दिया कि daily quota पूरा खर्च हो गया है
    अगले दिन Fable ने वही काम 3 मिनट में कर दिया, इसलिए K3 इस्तेमाल करना हो तो 20 डॉलर plan न खरीदना बेहतर है

    • Codex limit पर पहुंचने के बाद भी reasoning जारी रखता है और request का जवाब दे देता है
    • मैं पूरी तरह self-hosted models ही इस्तेमाल करता हूं, इसलिए environment अलग हो सकता है, लेकिन सोच रहा हूं कि real workflow में 12 मिनट तक बिना किसी feedback के इंतज़ार करना आम बात है क्या। मैं model किस रास्ते जा रहा है यह लगातार देखता रहता हूं और अगर वह dead end की तरफ जा रहा हो तो रोक देता हूं या दिशा बदल देता हूं
    • मेरे साथ भी बिल्कुल यही हुआ। Kimi.com का 20 डॉलर/month plan annual billing पर लिया और OpenCode में API के जरिए Kimi K2.7 को एक simple request भेजी, तो उसने 5 घंटे का quota पूरा खत्म कर दिया, जबकि Cursor ने वही request कुछ मिनटों में पूरी कर दी
      web screen पर weekly usage भी 23% खर्च हो गया, जबकि 20 डॉलर/month Cursor में इससे कहीं ज़्यादा काम करने पर भी कभी warning तक नहीं मिली। पहले लगा OpenCode की समस्या है, लेकिन अगर Kimi Code में भी ऐसा था तो शायद ऐसा नहीं है
    • कुछ दिन पहले Claude में भी एक अपेक्षाकृत simple task ने कोई जवाब दिए बिना पूरे 5 घंटे का quota खत्म कर दिया, और समय पूरी तरह बर्बाद लगा
    • target application का scale जानना चाहूंगा। यह इस पर निर्भर करता है कि वह text files को database की तरह इस्तेमाल करने वाला Node.js todo app है या 1971 में बना 10 लाख lines वाला COBOL spaghetti code
  • Kimi में full attention layers की तुलना में RNN/linear attention layers 3 गुना ज़्यादा हैं, यह खास तौर पर दिलचस्प है। अभी इस्तेमाल नहीं किया है, लेकिन long-context tasks के लिए यह architecture बहुत reasonable लगता है
    parameters ज़्यादा होने की वजह शायद वही है जो compute-optimized xLSTM में parameters ज़्यादा होने की वजह है, और इस model की सफलता देखकर अफसोस होता है कि Europe में कोई विशाल xLSTM-family model विकसित नहीं हो पाया। यह एक practical team है जो internal evals में अच्छा काम करने वाली चीज़ चुनती है, इसलिए उन्होंने normal attention layers भी रखीं, और implementation तक ideal है इसकी guarantee नहीं दी जा सकती, लेकिन Kimi दिखाता है कि अगर large-scale LLM training के लिए supercomputer सही researchers को दिया जाता तो क्या संभव था। आखिरकार यह ज़्यादातर Hochreiter का क्षेत्र, यानी RNN ही है

    • Transformer architecture का मूल उद्देश्यों में से एक parallelize न हो सकने वाले RNNs को हटाना नहीं था? मैं expert नहीं हूं, बस कुछ साल पहले कुछ papers पढ़े थे
    • करीब डेढ़ साल पहले Hochreiter से कहा था कि billions-parameter experiments पर न रुकें और xLSTM को LLM scale तक expand करें, लेकिन लगता था कि investment और attention पाने के लिए बहुत देर हो चुकी है। Europe की ambition इतनी ही है, यह अफसोस की बात है
    • सोच रहा था कि यह RNN है, Qwen या Mamba जैसा state space model है, या RWKV के करीब है; check करने पर पता चला कि यह Qwen द्वारा इस्तेमाल किए जाने वाले Linear DeltaNet जैसा है
  • लगभग 6 महीनों से coding tasks के लिए Kimi इस्तेमाल कर रहा हूं और संतुष्ट हूं, इसलिए दूसरे models पर वापस नहीं देखा। बस कभी-कभी Claude से वही task test कर लेता हूं कि कहीं कुछ miss तो नहीं हो रहा
    OpenRouter इस्तेमाल करता हूं और LLM usage का scope narrow है, इसलिए cost difference किसी भी तरफ negligible है

    • कौन सा plan है, जानना चाहूंगा। मेरे अनुभव में Kimi का 20 डॉलर/month plan और Qwen का 30 डॉलर/month plan दोनों primary tool के तौर पर इस्तेमाल करने के लिए बेहद अपर्याप्त थे, लेकिन K3 की वजह से 49 या 99 डॉलर/month plan test करना चाहता हूं
  • Google की तरह चुपचाप limits कम करने के बजाय, इस उम्मीद में कि users subscription value घटने पर ध्यान नहीं देंगे, नए subscriptions रोकना refreshing है
    Gemini Apps साफ लिखता है कि capacity constraints या activity spikes के समय quality बनाए रखने के लिए बिना notice limits बदल सकता है: https://support.google.com/gemini/answer/16275805

  • multi-agent game coding evals में Chinese models आम तौर पर single-shot reasoning में कमजोर होते हैं, लेकिन tool use और iterative improvement से इसकी भरपाई करते हैं। Kimi K3 भी single-shot coding में 19वें नंबर पर है, लेकिन execution environment और tools देकर कई बार call करने वाले agentic coding में 3वें नंबर पर था, और average submissions के आधार पर सिर्फ Sol और Fable आगे थे
    software engineers के लिए agentic coding सबसे relevant है, लेकिन speed भी important है, और अभी Kimi में यह real usability issue बनता है। Fireworks जैसे external inference providers ने previous models में यह gap कम किया है। open-weight frontier models का standard बनना दिलचस्प trend है, और सिर्फ frontier model own करके compete करना धीरे-धीरे मुश्किल होता जाएगा
    data: https://gertlabs.com/rankings?mode=agentic_coding

  • इस model की quality उम्मीद से बेहतर है और खासकर code reviews और PR reviews में अच्छा है। हालांकि बहुत ज़्यादा demand और बड़े model size की वजह से अभी यह बहुत slow है, इसलिए relatively simple code review में भी बहुत लंबा समय लगता है

    • Kimi K3 अब opencode-go pricing table में आ गया है, तो लगता है कि इस्तेमाल किया जा सकता है, हालांकि मैंने अभी confirm नहीं किया। Zen में नहीं है
    • OpenRouter route आज़माने लायक है: https://openrouter.ai/moonshotai/kimi-k3
  • सोच रहा हूं कि Kimi की यह लहर abundant supply से अधिक consumption को जन्म देने वाले Jevons paradox के तहत net increase है या बस लोग सस्ते model की ओर shift हुए हैं
    यह भी जानना चाहूंगा कि अलग-अलग labs और OpenRouter को मिलाकर total token consumption देखने के लिए कोई अच्छा source है या नहीं

    • अगर trend सस्ते model की ओर shift का होता तो लोग DeepSeek v4 Flash पर जाते। latest Kimi ज़्यादातर दूसरे Chinese models से महंगा है, इसलिए यह “नया model सच में अच्छा है, try करो” वाले trend-following effect जैसा लगता है। सवाल यह है कि close scrutiny को कितना झेल पाएगा, और US labs शायद काफी nervous होंगे
  • सोच रहा हूं कि Anthropic और OpenAI क्या कुछ समय तक सिर्फ इसलिए competitive बने रहेंगे कि वे ही इस level की demand संभाल सकने वाले providers हैं। Costs पहले ही बड़े हैं, और outages से employees का time waste हो तो enterprise customers इसे पसंद नहीं करेंगे

    • workplace में भी यही pattern दिखता है। software खुद सस्ता है, लेकिन hosting expertise और uptime responsibility की वजह से real deployments अभी भी कुछ providers तक केंद्रित हैं। हालांकि personal laptops पर चलने वाले vibe coding productivity tools भी बहुत आ रहे हैं
    • Anthropic ने भी कुछ ही महीने पहले demand issues के चलते peak और off-peak usage अलग करके users को परेशान किया था, और outages भी frequent थे। बाद में xAI के साथ contract के बाद generally stable हो गया, और Moonshot भी अभी compute resource contract पर काम कर रहा है
    • OpenAI और Anthropic के compute resources का बड़ा हिस्सा वास्तव में hyperscalers के ownership में है। वे long-term contracts से secured resource access पर margin लगा सकते हैं, लेकिन hyperscalers lower prices offer कर सकते हैं, इसलिए यह शायद ज्यादा दिन न चले
    • Kimi open-weight model है, इसलिए Moonshot के अलावा hosting providers जल्दी सामने आएंगे, और यह issue open-weight adoption में बड़ी बाधा नहीं बनेगा
    • मैं Synthetic इस्तेमाल कर रहा हूं और मेरी जानकारी में वे Kimi3 host करने की योजना बना रहे हैं। open models inference को distribute कर सकते हैं
  • लगता है subscription इसलिए रोका गया क्योंकि उन्होंने आंका कि customers को minimum service quality guarantee नहीं कर पाएंगे

    • बिल्कुल सही कहें तो उन्होंने सिर्फ नए subscriptions अस्थायी रूप से रोके हैं और existing members को compute resources priority से allocate किए हैं