1 पॉइंट द्वारा GN⁺ 2 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Kimi Linear एक hybrid संरचना है जिसमें KDA और MLA को 3:1 अनुपात में रखा गया है, और समान training conditions में इसने पूरे MLA की तुलना में short-term और long-term context तथा reinforcement learning evaluation के सभी पहलुओं में बेहतर प्रदर्शन दर्ज किया
  • इसका core module Kimi Delta Attention(KDA), Gated DeltaNet के head-wise forget gate को channel-wise स्तर तक विभाजित करता है, ताकि सीमित RNN memory के हर feature dimension की forget rate स्वतंत्र हो
  • विशेष Diagonal-Plus-Low-Rank(DPLR) transition matrix और chunk-wise parallel algorithm के जरिए इसने सामान्य DPLR की तुलना में computation कम किया, और operator efficiency लगभग 100% बेहतर हुई
  • 3B active parameters और 48B total parameters वाले मॉडल को 1.4T tokens पर train करके MMLU-Pro 4K में 51.0 अंक, RULER 128K में 84.3 अंक और 3.98x acceleration हासिल किया गया, जबकि 1M tokens पर प्रति output token समय MLA से 6.3x तेज रहा
  • long-form generation के दौरान KV cache को अधिकतम 75% तक घटाते हुए इसे मौजूदा full-attention pipeline के cache और scheduling interface बदले बिना लागू किया जा सकता है, और KDA kernel, vLLM implementation तथा model checkpoints भी जारी किए गए हैं

दीर्घकालिक reasoning में full attention से बनने वाली bottleneck

  • agentic LLM और reinforcement learning आधारित test-time scaling को inference के दौरान लंबी trajectories, tool-use interactions और जटिल decision space को संभालना पड़ता है
  • standard softmax attention की time complexity quadratic रूप से बढ़ती है और KV cache context length के अनुपात में बढ़ता है, इसलिए throughput, context scaling और real-time interaction सीमित हो जाते हैं
  • linear attention computation complexity कम कर सकता है, लेकिन इसकी expressiveness सीमित होने के कारण short sequence language modeling में भी इसका प्रदर्शन softmax attention से कम रहा
  • हाल की gating और decay mechanisms तथा delta rule ने medium-length sequence में quality gap कम किया है, लेकिन finite-state capacity की वजह से pure linear structures में long-sequence modeling और in-context retrieval पर अब भी सीमाएँ हैं
  • कुछ global attention layers और कई linear layers को जोड़ने वाली hybrid संरचनाएँ quality और efficiency के बीच एक समझौते के रूप में सामने आईं, लेकिन मौजूदा मॉडलों का scale सीमित था या विविध benchmark evaluation की कमी थी

linear attention से Gated DeltaNet तक

  • basic linear attention matrix-form recurrent state में key-value association को लगातार accumulate करता है, और इसे अस्थायी associative memory यानी fast weight के रूप में उपयोग करता है
    • कौन-सी memory हटानी है, इसका कोई मानदंड न होने से state अनियंत्रित रूप से जमा होता जाता है और लंबे context में interference पैदा होता है
  • DeltaNet reconstruction loss के लिए online gradient descent चलाता है ताकि state keys से values को restore कर सके
    • यह classical delta rule का उपयोग करता है, जो मौजूदा state को लगातार correct करता है
    • rank-1 update generalized Householder transform के समकक्ष है और इसे chunk-wise parallelize किया जा सकता है
  • Gated DeltaNet(GDN) scalar forget gate αt जोड़कर पुरानी associations को decay करता है
    • यह gate fast weight पर weight decay की तरह काम करता है और data-dependent L2 regularization जैसे forgetting mechanism को लागू करता है
    • memory lifetime को नियंत्रित करते हुए और interference घटाते हुए यह DeltaNet की parallelization संरचना बनाए रखता है
  • transition matrix data-dependent और learnable होने के कारण GDN को multiplicative positional encoding के रूप में भी समझा जा सकता है, जो RoPE की orthogonality constraints को ढीला करता है

Kimi Delta Attention में सूक्ष्म memory control

  • KDA GDN के एकल scalar decay को diagonalized channel-wise gate से बदलता है, ताकि हर feature dimension की memory decay और positional information को स्वतंत्र रूप से नियंत्रित किया जा सके
  • channel-wise forget rate सीमित finite-state RNN memory को अधिक सटीकता से नियंत्रित करती है और Gated Linear Attention(GLA) जैसी granularity देती है
  • transition dynamics को विशेष DPLR matrix से parameterize किया गया है, जिससे classical delta rule के साथ consistency बनी रहती है
  • rank-1 matrix transforms की श्रृंखला को dense representation में compress किया जाता है, जिससे diagonal gating के तहत भी stable chunk-wise parallel processing संभव होती है

chunk-wise parallel algorithm

  • sequence को fixed-length chunks में बांटा जाता है, और हर chunk की initial state के रूप में पिछले chunk की अंतिम state का उपयोग होता है
  • WY representation कई rank-1 updates को एक compressed representation में बांधता है, और Comba expansion का अनुसरण करते हुए बाद की computation में अतिरिक्त matrix inversion की जरूरत नहीं पड़ती
  • UT transform matrix multiplication के बजाय ऑपरेशनों के FLOPs घटाता है, जिससे training के दौरान hardware utilization बढ़ता है
    • lower triangular matrix का inverse Gaussian elimination की forward substitution से row-wise निकाला जाता है
  • state update chunk-wise matrix form में किया जाता है, और output stage में inter-chunk recurrent processing तथा intra-chunk parallel processing को जोड़ा जाता है
  • intra-chunk computation को matrix multiplication-केंद्रित बनाकर Tensor Core throughput का उपयोग किया जाता है

सामान्य DPLR से कम computation

  • KDA और generalized DPLR दोनों fine-grained decay का समर्थन करते हैं, इसलिए representational capacity के लिहाज से इनकी तुलना संभव है
  • fine-grained decay chunk के भीतर division के दौरान numerical precision की समस्या पैदा कर सकता है
    • GLA log-domain computation और full-precision second-order chunking का उपयोग करता है, लेकिन half-precision matrix multiplication का लाभ सीमित होने से operator speed कम रहती है
  • KDA, DPLR transition के दोनों variables को key k से जोड़ता है
    • second-order chunk matrix computation को 4 से घटाकर 2 कर देता है
    • अतिरिक्त 3 matrix multiplications हटा देता है
  • input length के अनुसार kernel measurement में KDA की operator efficiency सामान्य DPLR से लगभग 100% बेहतर रही

Kimi Linear मॉडल संरचना

  • model backbone Moonlight का अनुसरण करता है, और token mixing layer के बाद MoE channel mixing layer रखी जाती है
  • हर KDA head के query, key और value की गणना ShortConv और Swish से होकर होती है
    • query और key में eigenvalue stability के लिए L2 normalization जोड़ी जाती है
    • key और value का head dimension सभी experiments में 128 रखा गया
  • channel-wise decay gate को head dimension के बराबर rank वाली low-rank projection से parameterize किया गया है, और GDN तथा Mamba जैसी decay function का उपयोग किया गया है
  • output projection से पहले head-wise RMSNorm और data-dependent output gate लगाया जाता है
    • output gate भी low-rank रखा गया है, ताकि full-rank gate जैसे प्रदर्शन को बनाए रखते हुए parameters की निष्पक्ष तुलना संभव हो
    • यह gate Attention Sink को कम करता है

KDA और MLA का 3:1 hybrid

  • pure linear attention की long-context retrieval सीमाओं की पूर्ति के लिए KDA layers के बीच full global attention वाली Full MLA layers रखी जाती हैं
  • एक ही layer के भीतर heads को मिलाने के बजाय पूरी layers को alternating तरीके से रखा गया है
    • layer-wise संरचना infrastructure को सरल बनाती है और training stability बढ़ाती है
  • experiments में 3 KDA layers के बाद 1 MLA layer दोहराने वाला 3:1 अनुपात quality और throughput के बीच सबसे अच्छा संतुलन देता है
  • long-form generation में केवल full-attention layers ही KV cache बनाए रखती हैं, इसलिए memory और KV cache उपयोग को अधिकतम 75% तक घटाते हुए global information flow बना रहता है

NoPE का उपयोग और evaluation results

  • सभी MLA layers पर positional encoding के बिना NoPE लागू किया गया है, और positional information तथा recency bias की जिम्मेदारी KDA उठाता है
  • KDA short convolution या sliding-window attention जैसे सहायक position-aware components के समान या उससे भी मजबूत भूमिका निभाता है
  • NoPE का उपयोग करने पर inference के दौरान MLA को efficient pure Multi-Query Attention(MQA) में बदला जा सकता है
  • RoPE की frequency-based tuning या YaRN जैसी techniques की जरूरत नहीं पड़ती, जिससे long-context learning सरल हो जाती है
  • 1.4T tokens पर समान तरीके से train किए गए comparison में Kimi Linear ने ये परिणाम दर्ज किए
    • MMLU-Pro 4K में 51.0 अंक के साथ MLA के 47.2 और GDN-H के 47.9 से बेहतर प्रदर्शन किया
    • RULER 128K में 84.3 अंक और 3.98x acceleration हासिल कर MLA के 81.3 और GDN-H के 80.5 को पीछे छोड़ा
    • 1M tokens पर time per output token(TPOT) 1.84ms रहा, जो MLA के 11.48ms की तुलना में 6.3x तेज है
    • लंबे sequence में भी TPOT कम रहता है, जिससे बड़े batch का उपयोग संभव होता है
  • pretraining मॉडल में 3B active parameters और 48B total parameters हैं, और इसने short context, long context तथा reinforcement-learning शैली के post-training tasks में full MLA से लगातार बेहतर प्रदर्शन किया
  • KDA kernel, vLLM integration, और Kimi-Linear-48B-A3B-Instruct checkpoint जारी किए गए हैं
    • इन्हें मौजूदा full-attention pipeline के cache या scheduling interface में बदलाव किए बिना बदला जा सकता है

1 टिप्पणियां

 
GN⁺ 2 시간 전
Hacker News की राय
  • हाल ही में जारी Kimi K3 पेपर को देखें तो यह यहाँ चर्चा किए गए Kimi Linear को बड़े पैमाने पर स्केल करता है, और native vision व reinforcement learning सुधार जैसी चीजें जोड़ता है
    https://arxiv.org/abs/2607.24653

  • जिज्ञासा है कि क्या अत्याधुनिक मॉडलों में दिखने वाली बुद्धिमत्ता सचमुच सिर्फ आर्किटेक्चर को स्केल करने पर ही उभरने वाला emergent phenomenon है
    एक ही आर्किटेक्चर वाला 10 लाख पैरामीटर मॉडल बुनियादी पहेलियाँ भी नहीं सुलझा पाता, जबकि 1 ट्रिलियन पैरामीटर मॉडल Jacobian conjecture का counterexample तक बना देता है — यह सहज बोध के खिलाफ लगता है। किसी साधारण sorting algorithm को ज़्यादा compute देने से वह quicksort को नहीं हरा देता, लेकिन आधुनिक LLM research कभी-कभी ऐसी दौड़ जैसी लगती है जहाँ उसी algorithm और आर्किटेक्चर को बस बड़ा करते जाओ और उम्मीद करो कि जवाब मिल जाएगा

    • यह machine learning में The Bitter Lesson के नाम से अच्छी तरह जाना-पहचाना पैटर्न है। हमें उन general methods की ताकत सीखनी चाहिए जो compute बहुत बढ़ने पर भी स्केल करते रहते हैं, और ऐसे methods खोज व learning हैं
      छोटा मूल लेख भी पढ़ने लायक है: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
    • मैं अब इस क्षेत्र में नहीं हूँ और मेरी पृष्ठभूमि भी LLM से ज़्यादा reinforcement learning की है, लेकिन आखिरकार अर्थ और बुद्धिमत्ता आंतरिक representations में ही समाई होती है। छोटे मॉडलों में input को meaning और output से जोड़ने वाली internal mapping शुरू से सीखने की capacity कम हो सकती है, या फिर simple sorting की तरह सिद्धांततः संभव होते हुए भी व्यवहार में असहनीय समय लग सकता है
      बड़े मॉडलों के लिए उस internal representation space में foothold बनाना आसान होता है, और optimization आगे बढ़ने के बाद संभव है कि ज़्यादातर weights खास कुछ न कर रहे हों। इस space को सीखने के लिए कितनी expressivity चाहिए यह अभी स्पष्ट नहीं है, लेकिन अब तक लगता है कि अरबों parameters चाहिए
      इससे भी दिलचस्प सवाल यह है कि मॉडल को data के प्रति कितना invariant होना चाहिए। मेरा मानना है कि mathematical reasoning और programming ने overall performance को इसलिए बहुत बढ़ाया क्योंकि वे व्यापक task set में दोहराई जा सकने वाली skills हैं। भाषा या task से स्वतंत्र programming logic पर गहन training शायद छोटे मॉडलों तक पहुँचने का रास्ता हो सकता है
    • मॉडल स्केल बढ़ाना बुद्धिमत्ता बढ़ाने के सबसे लगातार और भरोसेमंद तरीकों में से एक है। AI training एक ऐसी प्रक्रिया है जिसमें algorithms का उपयोग करके दूसरे algorithms को computationally खोजा और तराशा जाता है, और scale बढ़ाने से लक्ष्य के अनुकूल बेहतर algorithms खोजने के लिए संसाधन बढ़ते हैं
      एक उपमा से कहें तो छोटे मॉडल capacity और training signal की सीमाओं के कारण अंदर ही अंदर bubble sort स्तर पर अटके रह सकते हैं, जबकि बड़े मॉडल गहराई से खोजकर quicksort के करीब का तरीका ढूँढ सकते हैं
      बुद्धिमत्ता binary नहीं होती; 1 अरब पैरामीटर और 10 ट्रिलियन पैरामीटर वाले मॉडल दोनों में कुछ-न-कुछ बुद्धिमत्ता होती है। पहला statistical regularities पर इतना निर्भर रहता है कि उसे नज़रअंदाज़ करना आसान होता है, जबकि दूसरा अनसुलझी conjectures के नए counterexample ढूँढने तक आगे बढ़ गया है। इनके बीच भी अचानक छलांग से ज़्यादा छोटे-छोटे सुधारों के इकट्ठा होकर हिमस्खलन बनने जैसी स्थिति है
      गणितीय क्षमता जैसी ठोस उपलब्धियाँ भले अचानक छलांग जैसी दिखें, लेकिन नीचे-ही-नीचे गलतियाँ कम करने और गलतियों से उबरने की general capability धीरे-धीरे जमा होती रहती है। जब यह क्षमता काफ़ी अच्छी हो जाती है, तब मॉडल बिल्कुल नए तरह की तर्क समस्याएँ भी सुलझाने लगता है
    • deep learning theory के नज़रिये से देखें तो बुद्धिमत्ता मुख्यतः scale-up से आती है, और जब अच्छे से डिज़ाइन किए गए model-optimizer संयोजन में सरलता की ओर मजबूत implicit bias हो, तब मॉडल आकार के साथ performance लगातार बेहतर हो सकती है
      Marcus Hutter की lab ने इसे Solomonoff induction के रूप में व्यक्त किया और दिखाया कि यह bias सार्वभौमिक रूप से प्रभावी है। प्रभावी bias, curse of dimensionality को उल्टा इस्तेमाल करते हुए, कुछ वैसा काम कर सकता है जैसे अधिक data मिलने पर बेहतर उत्तर मिलते हैं — यानी बड़े मॉडलों में performance बढ़ती रह सकती है
      फिर भी, ऐसे गुण दिखाने वाले मॉडलों का वर्ग बेहद संकीर्ण है, और शायद हम बस किस्मत से उस बिंदु तक पहुँचे हैं। इसी वजह से सामान्य statistical principles अब भी आम तौर पर सिखाती हैं कि ऐसे व्यवहार की अपेक्षा नहीं करनी चाहिए
    • जिन चीज़ों को इंसान बुनियादी समस्या और बहुत कठिन समस्या मानते हैं, वे किसी absolute scale पर एक-दूसरे के बहुत क़रीब हो सकती हैं। फ़र्क़ मुख्यतः इस बात में है कि कितने प्रतिशत इंसान वह समस्या हल कर सकते हैं, और मानव क्षमता की निचली सीमा भी काफ़ी ऊँची है। ज़्यादातर इंसानों के लिए बुनियादी समस्याएँ सुलझाने वाले जानवर दुर्लभ हैं, लेकिन उनमें जटिल व्यवहार और learning संभव है, और neuron scale भी इंसानों से हास्यास्पद रूप से अलग नहीं है
      10 लाख से 1 ट्रिलियन पैरामीटर तक जाना 10 लाख गुना स्केल-अप है। यह कुछ वैसा है जैसे मानव मस्तिष्क को हर दिशा में 1% आकार तक, यानी कुछ mm स्तर तक, छोटा कर देना
  • मैंने Kimi Linear से internal models बनाना शुरू किया था, लेकिन बाद में आए Gated Deltanet 2 को expressivity के लिहाज़ से आगे का रूप लगा, और अपने tests में भी वह सचमुच बेहतर निकला
    https://arxiv.org/abs/2605.22791

    • पढ़ने पर यह LSTM को फिर से लागू करने जैसा लगा
  • research के लिए KDA kernel और vLLM implementation को open source करना, और pretraining व instruction-tuning model checkpoints तक जारी करना बहुत बढ़िया है

  • अगर आप Kimi की सफलता को सिर्फ distillation attack मानना चाहते हैं, तो इस research को नज़रअंदाज़ कर सकते हैं

    • अब इसे distillation attack कहना ही बंद कर देना चाहिए
    • यह बात कि चीनी labs प्रभावशाली innovation कर रही हैं, और यह संभावना कि उन्हें distillation से फ़ायदा मिला हो — दोनों साथ-साथ सच हो सकते हैं। किसका योगदान कितना है यह पता नहीं, लेकिन इनमें से सिर्फ एक ही सच हो सकता है कहना false dichotomy है
    • distillation को कोसना कुछ वैसा लगता है जैसे कोई casino card counting को कोसे
    • मैं चाहता हूँ कि AI race में अमेरिका जीते, लेकिन आज के ज़्यादातर inventions भी क्या पिछले ज्ञान की distillation नहीं हैं, यह समझना मुश्किल है। जिज्ञासा है कि क्या Anthropic यह दावा कर रहा है कि उनके द्वारा लाया गया data trade secret है
    • अत्याधुनिक मॉडल किसी एक ही तत्व से नहीं बनते। यह सिर्फ incremental improvement है और पूरे मॉडल की सफलता को नहीं समझाता; distillation पर रुख कैसा भी हो, training dataset बेहद महत्वपूर्ण है
  • समान आकार के full-attention मॉडल की तुलना में long-context retrieval, खासकर needle-in-a-haystack या RULER performance, कैसी है यह जानना चाहूँगा। efficiency gains शानदार हैं, लेकिन linear-attention hybrid मॉडल आमतौर पर इसी जगह टूट जाते हैं

  • सोचता हूँ कि अगर ऐसे non-standard Transformer व्यापक रूप से इस्तेमाल होने लगें, तो Etched जैसी कंपनियाँ मुश्किल में पड़ेंगी या नहीं

  • यह पेपर 2025 की सामग्री है और इसे आए 9 महीने हो चुके हैं; इस बीच प्रमुख मॉडल नए जारी हो चुके हैं

    • K3 के बारे में यह पेपर पढ़ना बेहतर है: https://arxiv.org/abs/2607.24653
      K3 पेपर का मुख्य योगदान Stable LatentMoE है। यह कुछ अन्य मॉडलों की तरह layers के बीच भेजे जाने वाले data को compress करता है, इसलिए router पर कुछ खास शर्तें लगती हैं, और K3 अधिक संतुलित expert selection strategy से performance बढ़ाता है
    • उस समय इस पर पर्याप्त चर्चा नहीं हुई थी: https://news.ycombinator.com/item?id=45766937
    • लगता है इसे नए Kimi K3 के साथ फिर से पोस्ट किया गया, जिसमें 69 KDA layers और 24 Gated MLA layers हैं। मेरी जानकारी में पिछला बड़ा Kimi मॉडल सिर्फ MLA layers इस्तेमाल करता था