2 पॉइंट द्वारा GN⁺ 2 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • पिछले साल जारी किए गए Kimi Linear को 48B से 2.8T तक स्केल करने वाला प्रोडक्शन मॉडल, और फिलहाल सार्वजनिक weight models में सबसे बड़ा
  • नया पेश किया गया LatentMoE बड़े linear layers को down projection करके compress करता है, और पूरी संरचना में सामान्य MoE और attention को inference efficiency-केंद्रित components से बदला गया है
  • attention residuals लेयर्स के बीच residuals को attention score-आधारित weights से जोड़ते हैं, जिससे validation loss और downstream performance में लगातार हल्का सुधार होता है
  • attention residuals की वजह से training cost लगभग 4% और inference cost लगभग 2% बढ़ती है, और सभी RoPE layers हटाकर पूरे मॉडल में NoPE लागू किया गया है
  • native multimodal support भी जोड़ा गया है, जिससे Kimi Linear के बड़े पैमाने के विस्तार के साथ inference efficiency और residual path सुधार दोनों को साथ में आगे बढ़ाया गया है

Kimi Linear से 2.8T तक विस्तार

  • Kimi K3, Kimi Linear का 48B से 2.8T तक स्केल किया गया प्रोडक्शन वर्ज़न है, और फिलहाल सार्वजनिक weight models में सबसे बड़ा है
  • Kimi Linear की तुलना में नया जोड़ा गया LatentMoE मूल रूप से Nemotron 3 Ultra के तरीके जैसा ही है
    • multi-head latent attention की तरह यह बड़े linear layers को down projection करके compress करता है
  • Nemotron 3 और DeepSeek V4 आदि में दिखी प्रवृत्ति की तरह इसका फोकस inference efficiency में सुधार पर है
    • सामान्य MoE को LatentMoE से बदला गया है
    • सामान्य attention की जगह multi-head latent attention और Kimi Delta Attention का उपयोग किया गया है

residual path और positional information

  • attention residuals efficiency optimization के लिए नहीं बल्कि residual path सुधार के लिए बना component है, और यह Kimi Linear में भी पहले से लागू था
    • DeepSeek V4 के mHC(manifold-constrained Hyper-Connections) की तरह residual path को चौड़ा करने के बजाय, attention residuals लेयर्स के बीच residuals को जोड़ते हैं
    • हर residual की importance या contribution दिखाने वाले attention scores को connection weights के रूप में इस्तेमाल किया जाता है
    • तकनीकी रिपोर्ट के अनुसार validation loss और downstream performance में लगातार हल्का सुधार होता है, लेकिन training cost लगभग 4% और inference cost लगभग 2% बढ़ जाती है
  • सभी RoPE layers हटाकर NoPE, यानी कोई positional embedding नहीं, को सभी layers पर लागू किया गया है
    • हाल की दूसरी architectures में sliding window attention जैसी local attention में RoPE और global layers में NoPE इस्तेमाल करने की प्रवृत्ति रही है
    • पहले भी केवल NoPE इस्तेमाल करने वाली architectures रही हैं, लेकिन Kimi K3 उपलब्ध जानकारी के दायरे में इसे पूरी तरह लागू करने वाला पहला frontier-grade model है

native multimodal support

  • Kimi K3 में native multimodal support भी जोड़ा गया है

1 टिप्पणियां

 
GN⁺ 2 시간 전
Hacker News की राय
  • पश्चिमी रिसर्च लैब्स के प्रमुखों द्वारा Kimi को सिर्फ distillation attack का नतीजा बताने के उलट, असल में यह नए और मौलिक तरीके अपना रहा है

  • Sebastian Raschka बेहतरीन बड़े language model शोधकर्ता और लेखक हैं, और उनके Substack की मैं जोरदार सिफारिश करता हूं

    • पहले नहीं जानता था, लेकिन यह देखकर प्रभावित हुआ कि वे सीधे मुद्दे की बात करते हुए भी समझने में आसान लिखते हैं
    • जल्दबाजी में बनाए गए AI summaries से भरे इस क्षेत्र में यह दुर्लभ रत्न जैसा लगा, इसलिए इसे अपने RSS feed में जोड़ लिया
  • कहा गया है कि “दिलचस्प बात यह है कि Kimi K3 सभी RoPE layers हटा देता है और उसकी जगह हर जगह NoPE(No Positional Embeddings) इस्तेमाल करता है”
    यह काम करता है, यही अपने आप में हैरान करने वाला है। अगर positional जानकारी नहीं है तो क्या यह tokens का सूप नहीं बन जाएगा? क्या attention इतना सटीक है कि दूसरा token सिर्फ embedding space में कुछ जमा करना सीखकर यह समझ सके कि वह दूसरा है?

    • causal masking के जरिए model implicit positional embeddings सीख सकता है। यह आम धारणा कि Transformer blocks permutation-invariant होते हैं, असल में सही नहीं है
    • decoder-only causal Transformer में positional embeddings अनिवार्य नहीं हैं, लेकिन मूल Transformer paper के encoder जैसे non-causal models में वे निश्चित रूप से जरूरी हैं
      जमा होने वाली intuition भी ठीक है। अगर कुछ attention heads residual stream के उसी क्षेत्र में लगातार values लिखते रहें, तो input tokens बढ़ने के साथ attention summation से values जमा होती जाएंगी और अलग positional encoding के बिना भी एक तरह के index की तरह काम कर सकती हैं
    • linear layers FIR filter जैसे decay का इस्तेमाल करके स्वाभाविक रूप से relative position देते हैं। तब full attention layers दूरी की परवाह किए बिना concepts को जोड़ने पर ध्यान दे सकती हैं
    • ऐसे hybrid attention models में कम से कम state space model(SSM) layers तो recurrent structure के जरिए relative positional embeddings को भीतर ही समेटे हुए होंगी
  • हर जगह NoPE इस्तेमाल करना दिलचस्प है। दूसरे models आमतौर पर local layers में RoPE छोड़ देते हैं, लेकिन यहां लगता है कि Kimi Delta जैसी linear attention layers चुपचाप positional handling कर रही थीं, इसलिए इसे हटाया जा सका। जानना चाहूंगा कि यह cutting-edge scale पर भी कायम रहेगा या नहीं

    • नाम के बावजूद Kimi Delta Attention(KDA) सामान्य अर्थ में attention से ज्यादा, training के दौरान efficiently parallelize किए जा सकने वाले RNN के करीब है। यह Gated DeltaNet का थोड़ा बदला हुआ structure है, जिसमें hidden state होता है जो छोटे editable attention memory जैसा काम करता है
      RNN जैसा होने के कारण यह XYZ में X, Y, Z के क्रम को मूल रूप से पहचानता है। मूल Transformer unordered set को process करता है, इसलिए items के बीच position अलग से बतानी पड़ती है
      हर attention layer के लिए 3 KDA layers हैं और पहली attention layer से पहले भी 3 हैं, इसलिए सभी tokens पहली असली attention layer तक पहुंचने से पहले अपनी position information सीख सकते हैं
      RoPE जानकारी को कुछ हद तक खराब करता है, इसलिए अगर इसे ऐसे हटाया जा सके तो फायदा है। Gemma-4 में भी हर global attention layer पर पांच sliding window attention(SWA) layers रखने वाली मिलती-जुलती 5:1 संरचना है। SWA सस्ता और कम performant है, लेकिन local information process करता है और मजबूत global layers के बीच जगह भरता है; इस model में KDA वही भूमिका निभाता है
      Gemma में RoPE सिर्फ वास्तविक attention यानी SWA में जरूरी है, global attention में इसे हटा दिया जाता है। KDA attention नहीं है, इसलिए positional embedding की जरूरत नहीं है
      नहीं पता कि इससे कितना और अधिक cutting-edge scale चाहिए होगा, लेकिन बड़े scale पर यह काम नहीं करेगा, ऐसा कोई कारण नहीं दिखता। parameters जितने बढ़ेंगे, KDA layers के लिए positional information पहुंचाना उल्टा आसान होगा
    • Kimi K3 benchmarks में Opus और Fable जैसी range में है, इसलिए सवाल है कि इससे बड़ा scale ही cutting-edge है या नहीं। ये सभी 2–4 trillion parameters range में हैं, और मुख्य फर्क training quality और architecture में होने की उम्मीद है
    • एक थोड़ा अजीब side effect भी है। जिन providers को आजमाया, उन्होंने KV cache को सिर्फ latest input prompt तक store करने के बजाय 1,024-token fixed incremental blocks के रूप में implement किया है। नतीजतन हर inference में cache miss input tokens अधिकतम 1,023 तक अतिरिक्त जुड़ जाते हैं