- पिछले साल जारी किए गए Kimi Linear को 48B से 2.8T तक स्केल करने वाला प्रोडक्शन मॉडल, और फिलहाल सार्वजनिक weight models में सबसे बड़ा
- नया पेश किया गया LatentMoE बड़े linear layers को down projection करके compress करता है, और पूरी संरचना में सामान्य MoE और attention को inference efficiency-केंद्रित components से बदला गया है
- attention residuals लेयर्स के बीच residuals को attention score-आधारित weights से जोड़ते हैं, जिससे validation loss और downstream performance में लगातार हल्का सुधार होता है
- attention residuals की वजह से training cost लगभग 4% और inference cost लगभग 2% बढ़ती है, और सभी RoPE layers हटाकर पूरे मॉडल में NoPE लागू किया गया है
- native multimodal support भी जोड़ा गया है, जिससे Kimi Linear के बड़े पैमाने के विस्तार के साथ inference efficiency और residual path सुधार दोनों को साथ में आगे बढ़ाया गया है
Kimi Linear से 2.8T तक विस्तार
- Kimi K3, Kimi Linear का 48B से 2.8T तक स्केल किया गया प्रोडक्शन वर्ज़न है, और फिलहाल सार्वजनिक weight models में सबसे बड़ा है
- Kimi Linear की तुलना में नया जोड़ा गया LatentMoE मूल रूप से Nemotron 3 Ultra के तरीके जैसा ही है
- multi-head latent attention की तरह यह बड़े linear layers को down projection करके compress करता है
- Nemotron 3 और DeepSeek V4 आदि में दिखी प्रवृत्ति की तरह इसका फोकस inference efficiency में सुधार पर है
- सामान्य MoE को LatentMoE से बदला गया है
- सामान्य attention की जगह multi-head latent attention और Kimi Delta Attention का उपयोग किया गया है
residual path और positional information
- attention residuals efficiency optimization के लिए नहीं बल्कि residual path सुधार के लिए बना component है, और यह Kimi Linear में भी पहले से लागू था
- DeepSeek V4 के mHC(manifold-constrained Hyper-Connections) की तरह residual path को चौड़ा करने के बजाय, attention residuals लेयर्स के बीच residuals को जोड़ते हैं
- हर residual की importance या contribution दिखाने वाले attention scores को connection weights के रूप में इस्तेमाल किया जाता है
- तकनीकी रिपोर्ट के अनुसार validation loss और downstream performance में लगातार हल्का सुधार होता है, लेकिन training cost लगभग 4% और inference cost लगभग 2% बढ़ जाती है
- सभी RoPE layers हटाकर NoPE, यानी कोई positional embedding नहीं, को सभी layers पर लागू किया गया है
- हाल की दूसरी architectures में sliding window attention जैसी local attention में RoPE और global layers में NoPE इस्तेमाल करने की प्रवृत्ति रही है
- पहले भी केवल NoPE इस्तेमाल करने वाली architectures रही हैं, लेकिन Kimi K3 उपलब्ध जानकारी के दायरे में इसे पूरी तरह लागू करने वाला पहला frontier-grade model है
native multimodal support
- Kimi K3 में native multimodal support भी जोड़ा गया है
1 टिप्पणियां
Hacker News की राय
पश्चिमी रिसर्च लैब्स के प्रमुखों द्वारा Kimi को सिर्फ distillation attack का नतीजा बताने के उलट, असल में यह नए और मौलिक तरीके अपना रहा है
Sebastian Raschka बेहतरीन बड़े language model शोधकर्ता और लेखक हैं, और उनके Substack की मैं जोरदार सिफारिश करता हूं
कहा गया है कि “दिलचस्प बात यह है कि Kimi K3 सभी RoPE layers हटा देता है और उसकी जगह हर जगह NoPE(No Positional Embeddings) इस्तेमाल करता है”
यह काम करता है, यही अपने आप में हैरान करने वाला है। अगर positional जानकारी नहीं है तो क्या यह tokens का सूप नहीं बन जाएगा? क्या attention इतना सटीक है कि दूसरा token सिर्फ embedding space में कुछ जमा करना सीखकर यह समझ सके कि वह दूसरा है?
जमा होने वाली intuition भी ठीक है। अगर कुछ attention heads residual stream के उसी क्षेत्र में लगातार values लिखते रहें, तो input tokens बढ़ने के साथ attention summation से values जमा होती जाएंगी और अलग positional encoding के बिना भी एक तरह के index की तरह काम कर सकती हैं
हर जगह NoPE इस्तेमाल करना दिलचस्प है। दूसरे models आमतौर पर local layers में RoPE छोड़ देते हैं, लेकिन यहां लगता है कि Kimi Delta जैसी linear attention layers चुपचाप positional handling कर रही थीं, इसलिए इसे हटाया जा सका। जानना चाहूंगा कि यह cutting-edge scale पर भी कायम रहेगा या नहीं
RNN जैसा होने के कारण यह XYZ में X, Y, Z के क्रम को मूल रूप से पहचानता है। मूल Transformer unordered set को process करता है, इसलिए items के बीच position अलग से बतानी पड़ती है
हर attention layer के लिए 3 KDA layers हैं और पहली attention layer से पहले भी 3 हैं, इसलिए सभी tokens पहली असली attention layer तक पहुंचने से पहले अपनी position information सीख सकते हैं
RoPE जानकारी को कुछ हद तक खराब करता है, इसलिए अगर इसे ऐसे हटाया जा सके तो फायदा है। Gemma-4 में भी हर global attention layer पर पांच sliding window attention(SWA) layers रखने वाली मिलती-जुलती 5:1 संरचना है। SWA सस्ता और कम performant है, लेकिन local information process करता है और मजबूत global layers के बीच जगह भरता है; इस model में KDA वही भूमिका निभाता है
Gemma में RoPE सिर्फ वास्तविक attention यानी SWA में जरूरी है, global attention में इसे हटा दिया जाता है। KDA attention नहीं है, इसलिए positional embedding की जरूरत नहीं है
नहीं पता कि इससे कितना और अधिक cutting-edge scale चाहिए होगा, लेकिन बड़े scale पर यह काम नहीं करेगा, ऐसा कोई कारण नहीं दिखता। parameters जितने बढ़ेंगे, KDA layers के लिए positional information पहुंचाना उल्टा आसान होगा