- Kimi K3 2.8 ट्रिलियन parameters और 1,048,576-token context वाला open-weight native multimodal agent model है, जो लंबे coding sessions, knowledge work और reasoning को support करता है
- Kimi Delta Attention(KDA), Attention Residuals और Stable LatentMoE को मिलाकर यह 896 experts में से हर token के लिए 16 को activate करता है, और Kimi K2 की तुलना में कुल scaling efficiency लगभग 2.5 गुना अधिक है
- सार्वजनिक evaluation में इसने GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1 दर्ज किया, लेकिन model-specific harness, inference settings और hardware differences को साथ में ध्यान में रखना चाहिए
- MXFP4 weights·MXFP8 activations के साथ quantization-aware training की गई है, और इसे Transformers, vLLM, SGLang, Docker तथा OpenAI·Anthropic-compatible API से चलाया जा सकता है
- multi-turn और tool calls में API द्वारा लौटाए गए पूरे assistant message को, जिसमें
reasoning_contentऔरtool_callsशामिल हैं, जस का तस वापस पास करना होगा; code और weights Kimi K3 License के तहत जारी हैं
Model architecture और scale
- Kimi K3 लंबे coding sessions, knowledge work और reasoning के लिए design किया गया open-weight native multimodal agent model है
- कुल parameters 2.8T हैं, active parameters 104B हैं, और इसमें 93 layers हैं
- 1 Dense layer, 69 KDA layers और 24 Gated MLA layers इस्तेमाल किए गए हैं
- Attention hidden dimension 7,168 है और attention heads 96 हैं
- Stable LatentMoE 896 experts में से हर token के लिए 16 चुनता है और 2 shared experts का उपयोग करता है
- Latent MoE dimension 3,584 है, और प्रति expert MoE hidden dimension 3,072 है
- Kimi K2 की तुलना में कुल scaling efficiency लगभग 2.5 गुना बेहतर हुई है
- Vocabulary size 160K है, context length 1,048,576 tokens है, और activation function SiTU-GLU है
- Vision encoder के रूप में 401M parameters वाला MoonViT-V2 इस्तेमाल किया गया है
- मुख्य capabilities में text, image और video understanding शामिल हैं, लेकिन model summary table के modality item में केवल Text और Image लिखे गए हैं
लंबे coding sessions और knowledge work
- न्यूनतम human supervision के साथ लंबे engineering sessions जारी रखते हुए बड़े repositories को explore करता है और terminal tools को orchestrate करता है
- GPU kernel optimization और compiler development को support करता है
- vision का उपयोग करने वाले game development, CAD और chip design भी target में शामिल हैं
- Agentic knowledge work में यह deep research के साथ interactive visualizations, widgets और dashboards बनाता है
- motion design और video editing भी support scope में आते हैं
- coding agent framework के रूप में Kimi Code CLI की सिफारिश की जाती है, और terminal में
/modelcommand से Kimi K3 चुना जा सकता है
Evaluation results
- सभी Kimi K3 results
reasoning_effort="max", temperature 1.0 पर measure किए गए- GPQA Diamond, HLE-Full और tool-less vision evaluation जैसे single-step tasks के लिए top-p 0.95 इस्तेमाल किया गया
- agent tasks के लिए top-p 1.0 लागू किया गया
- Reasoning और knowledge evaluation में GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7 दर्ज हुए
- HLE-Full बिना tools 43.5 और tools के साथ 56.0 है
- Coding evaluation में ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2 दर्ज हुए
- DeepSWE में Kimi Code harness पर 67.5 और mini-SWE-agent harness पर 67.3 है
- SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9 दर्ज हुए
- Agent evaluation में BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2 दर्ज हुए
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8 हैं
- Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2 मापे गए
- Vision evaluation में OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1 दर्ज हुए
- MMMU-Pro बिना tools 81.6 और tools के साथ 83.4 है
- MathVision 94.3 से Python इस्तेमाल करने पर 97.8 तक बढ़ता है
- ZeroBench pass@5 tools के साथ 23.0 से 41.0 तक बढ़ता है
Evaluation conditions और comparison limits
- Comparison models में Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2 शामिल हैं, लेकिन evaluation harness हर model के लिए अलग हो सकता है
- Kimi K3 मुख्य रूप से Kimi Code या Claude Code इस्तेमाल करता है
- GPT series मुख्य रूप से Codex, और अन्य Claude·GLM models Claude Code या Terminus 2 आदि इस्तेमाल करते हैं
- SWE-Marathon को final v1.1 से पहले, 9 जुलाई 2026 तक के tasks को H20 के लिए adjusted branch पर evaluate किया गया
- Docker images, GPU performance baselines और reference oracle को H20 के लिए re-calibrate किया गया, लेकिन accuracy और anti-cheating validators नहीं बदले गए
- Claude Fable 5 में 35% tasks पर fallback हुआ, जिससे measured performance पर नकारात्मक असर पड़ा हो सकता है
- PostTrainBench official environment के H100 के बजाय H20 GPU पर maximum reasoning effort के साथ चलाए गए 3 results का average है
- Kimi Code Bench 2.0 में cybersecurity और safety tasks शामिल हैं
- Claude Fable 5 में 80 tasks में से 13 fallback और 1 refusal हुआ
- GPT-5.6 Sol ने 10 और GPT-5.5 ने 3 tasks refuse किए
- BrowseComp 91.2 वह result है जिसमें 300K tokens पर काम करने वाली context compression strategy इस्तेमाल की गई
- अलग context management के बिना पूरे 1M-token window का उपयोग करने पर 90.4 दर्ज हुआ
- Multimodal evaluation में ZeroBench को छोड़कर 3-run average इस्तेमाल किया गया
- ZeroBench को official settings के अनुसार 5 बार चलाया गया
- PerceptionBench atomic visual perception ability मापने वाला internal benchmark है
Native quantization
- SFT stage से ही quantization-aware training लागू की गई
- Weights के लिए MXFP4 और activations के लिए MXFP8 इस्तेमाल कर व्यापक hardware compatibility लक्ष्य बनाया गया
Deployment और चलाने का तरीका
kimi-k3चुनकर Kimi API access किया जा सकता है, और यह OpenAI·Anthropic-compatible API देता है- Hugging Face Transformers में इसे
pipeline("image-text-to-text", ...)याAutoModel.from_pretrained(...)से load किया जा सकता है- custom model code इस्तेमाल करने के लिए
trust_remote_code=Trueजरूरी है
- custom model code इस्तेमाल करने के लिए
- Local serving vLLM और SGLang को support करती है
- दोनों engines OpenAI-compatible
/v1/chat/completionsendpoint पर text और image requests handle कर सकते हैं
- दोनों engines OpenAI-compatible
- Docker Model Runner में इसे
docker model run hf.co/moonshotai/Kimi-K3से चलाएं - Model HuggingChat, Google Colab और Kaggle पर भी इस्तेमाल किया जा सकता है
API usage में reasoning state को preserve करना
- Kimi K3 में thinking mode हमेशा active रहता है और यह
reasoning_contentलौटाता है - top-level request field
reasoning_effort"low","high","max"support करता है, और default"max"है - multi-turn conversations और tool calls को preserved thinking history approach के अनुरूप होना चाहिए
- API द्वारा लौटाया गया assistant message
messagesमें जस का तस वापस pass करना होगा - सिर्फ
contentही नहीं,reasoning_contentऔरtool_callsभी शामिल करने होंगे
- API द्वारा लौटाया गया assistant message
- Vision input, structured output, partial mode, tool selection, dynamic tool loading और context caching के लिए Kimi K3 Quickstart और Thinking Effort देखें
License
- Code repository और model weights दोनों Kimi K3 License के तहत जारी हैं
2 टिप्पणियां
अच्छा होगा अगर देश में इसे उपलब्ध कराने वाली कोई कंपनी आ जाए।
Hacker News की राय
3 ट्रिलियन parameter model की third-party मध्यवर्ती कीमत तय हो जाए, तो वास्तविक serving cost और यह अंदाज़ा लगाया जा सकेगा कि labs API tokens को subsidize कर रही हैं या नहीं
MXFP4 native होने से लगभग 1.5TB VRAM चाहिए, जो 8×B200 की सीमा के आसपास है; context length और throughput optimization तक सोचें तो व्यावहारिक रूप से 16 cards की जरूरत लगती है
Cybersecurity AISI benchmark में यह GLM 5.2 से ऊपर है, लेकिन state-of-the-art closed models से बड़ा gap है, इसलिए fine-tuning की जरूरत पड़ सकती है। यह भी उत्सुकता है कि Cursor इसे Kimi 2.6/2.7 fine-tuned Composer series और Grok 4.5 से सीधे compare कराने के लिए फिर से train करेगा या नहीं
पूरी probability distribution सीखने वाली ठीक-ठाक knowledge distillation से छोटे models बनने की संभावना भी उम्मीद जगाती है। खासकर serving cost कम होने वाला DSV4-Kimi promising लगता है
used 4U server और 64GB ECC DIMM के 32 sticks से 3TB RAM बनाएं तो लागत 30,000 डॉलर से कम है, इसलिए वास्तविक GPU rigs से कीमत में बड़ा अंतर है। अभी full-precision weights या Unsloth के Q8/Q8-XL quantized versions नहीं हैं, लेकिन भरपूर context भी इस्तेमाल करना हो तो 1,536GB से आगे 2TB, और संभव हो तो 2.5~3TB चाहिए लगता है
Q4 और Q6 knowledge और precision खोते हुए भी धीमे और भरोसेमंद न रहने वाले सबसे खराब compromise बन सकते हैं, इसलिए low-budget hardware पर smart लेकिन slow model चलाना हो तो Q8 जरूरी लगता है
https://github.com/woct0rdho/transformers5-qwen3.5-recipe पर proof of concept बनाया है; CPU offloading के बिना Qwen3.5-35B-A3B को 16GiB VRAM में, और DeepSeek-V4-Flash 284B-A13B को 90GiB VRAM में fine-tune किया जा सकता है। Strix Halo जैसे unified memory systems पर भी यह अच्छा चलता है
फिर भी Kimi-K3 स्तर के model के लिए कई GPUs और nodes चाहिए होंगे, इसलिए single-GPU training की तुलना में हल करने को बहुत ज्यादा चीजें हैं
इस release में कीमत से कहीं ज्यादा दिलचस्प हिस्सा customization है। startups भी weights download करके बदल और fine-tune कर सकती हैं, और असली फायदा cost से ज्यादा अपने data पर performance और intellectual property sovereignty में है। Kimi team की बड़ी उपलब्धि है
लगता है कि individuals के LLM चलाने के लिए hardware use case के हिसाब से ठीक से configured नहीं है। या तो unified memory में 5~10 tokens per second से काम चलाना पड़ता है, या सैकड़ों GB VRAM और 1kW से ज्यादा खपत वाले datacenter cards तक जाना पड़ता है
TDP 180~250W में 128GB या 256GB VRAM वाला prosumer GPU नहीं है; ऐसी दो cards और common NVLink-level connection भी हो तो काफी उपयोगी होगा। Kimi K3 को local चलाने के लिए बहुत बड़ा homelab और खर्च चाहिए होगा, लेकिन GLM 5.2 को single session में करीब 100 tokens per second, और कई sub-agents इस्तेमाल करने पर करीब 60 tokens per second पर चला पाना अच्छा होगा
latest
llama-serverको--no-mmapके साथ चलाने पर measurements DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiB अनुमानित हैंइसके उलट desktop workload भी intermittent होता है, लेकिन required compute performance इतनी सस्ती हो गई है कि idle state में overkill hardware भी desk पर रखा जा सकता है
gpt-ossजैसे कुछ exceptions छोड़कर open models चलाना कठिन बनाते हैं, फिर भी democratization की बात करते हैं—यह खास तौर पर अनुचित लगता हैअगर कुछ हजार डॉलर का GPU खरीद सकता हूं, तो affluent tech enthusiast के रूप में खरीदूंगा, लेकिन मानना होगा कि यह sports car जैसी बेहद inefficient luxury है। असली दुर्भाग्य यह है कि trusted तरीके से shared hardware चलाने के लिए हमारे पास computing technology या political/social institutions नहीं हैं
लाइसेंस के अनुसार, अगर लाइसेंस धारक या उसकी affiliate कंपनियां model-as-a-service business चलाती हैं और लगातार 12 महीनों का कुल revenue 20 मिलियन डॉलर से अधिक हो जाता है, तो software या derivatives का व्यावसायिक उपयोग करने से पहले Moonshot AI के साथ अलग agreement करना होगा
https://app.fireworks.ai/models/fireworks/kimi-k3 पर उपलब्ध है, और pricing uncached input के लिए 3 डॉलर प्रति 1 मिलियन tokens, cached input के लिए 0.30 डॉलर, और output के लिए 15 डॉलर है
फिलहाल इसकी latency Moonshot की तुलना में काफी कम है, लेकिन usage भी बहुत कम है, इसलिए यह बना रहेगा या नहीं—देखना होगा। फिर भी same-day deployment प्रभावशाली है
प्रतिस्पर्धा के कारण GLM 5.2 pricing 16 जून को launch होने के लगभग 1.5 महीने बाद करीब 45% घट गई, और अभी भी नए providers price competition कर रहे हैं: https://openrouter.ai/z-ai/glm-5.2#providers
अर्थशास्त्र के हिसाब से price total cost से कम नहीं होनी चाहिए ऐसा नहीं है; वह marginal cost से कम नहीं होनी चाहिए। और किसी data center में GPU utilization कम हो तो यह मोटे तौर पर electricity cost के बराबर होता है। छोटे data centers में excess capacity और competition के कारण, जल्द ही कुछ provider tokens को electricity cost और GPU depreciation के संयुक्त स्तर से भी कम पर बेच सकते हैं—ऐसा अनुमान है
Hugging Face पर “Tell me about yourself” पूछने पर Kimi K3 ने खुद को Anthropic द्वारा बनाया गया Claude बताया, जो दिलचस्प था
frontier models को preservation के लिए download करके रखने की सलाह है। 1.5TB भी सस्ते disk में रखकर torrent seed करें तो अधिक उपयोगी होगा
जैसे पहले encryption algorithms को control करने की कोशिश हुई थी, वैसे models भी regulation से बंद किए जा सकते हैं; और public software तभी बचता है जब वह व्यापक रूप से distributed हो। समय के साथ techniques और hardware manufacturing में भारी investment के कारण practical execution संभव हो जाएगा, लेकिन अगर तब distribution illegal हो जाए और regulatory capture की लागत चुकानी पड़े, तो यह अफ़सोस की बात होगी
magnet address
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounceहैlicense की समीक्षा और actual hardware पर testing के बाद, providers के लिए Moonshot pricing से 60–70% सस्ता देना मुश्किल लगता है। थोड़ा कम किया जा सकता है, लेकिन processing speed को काफी sacrifice किए बिना GLM जैसे discounts मुश्किल लगते हैं
Kimi के margins, यह मानते हुए भी कि GPU महंगे rental rates पर लिए गए हैं, करीब 40–50% अनुमानित हैं; अगर खुद का equipment हो तो और ज्यादा हो सकते हैं। लेकिन यह कुछ लोगों द्वारा अनुमानित Anthropic के 90%+ margins तक नहीं पहुंचता, और Anthropic API margin 80% भी संदिग्ध लगता है
अगर electricity ही एकमात्र cost हो तो 80–90% भी संभव होगा, लेकिन अभी उपलब्ध tokens per second को देखते हुए यह आसान नहीं है। केवल B200 पर test किया है, B300 नहीं मिल पाया; और यह पहले से quantized model है तथा 1 million token context भी इस्तेमाल नहीं कर रहा, इसलिए immediate memory optimization की गुंजाइश भी कम दिखती है। अच्छा होगा अगर R100 access वाला कोई व्यक्ति cost verify कर दे
बड़े providers को Kimi के साथ contract करना होगा, इसलिए जब तक Kimi top-tier open model है, बड़े discount की उम्मीद करना मुश्किल है
मूल लिंक 404 लौटा रहा है, इसलिए सोच रहा हूँ कि क्या इसे ब्लॉक किया गया है या self-censor किया गया है
सरकारी नियंत्रण की वजह से अचानक गायब होने की संभावना को देखते हुए इसे archive करने की demand हो सकती है। चीन ने भी हाल में model export controls पर चर्चा शुरू की है, और अब जब वह पीछे रह गए models नहीं बल्कि cutting-edge models जारी करने लगा है, तो स्थिति अलग हो गई है