- लगभग 1,030 एजेंट टास्क पर Kimi K3 और Fable 5 की तुलना में, टास्क-आधारित routing ने 93% accuracy के साथ अलग-अलग मॉडलों से बेहतर quality हासिल की
- SWE, terminal, algorithm, multilingual और legal टास्क में overall performance समान रही, लेकिन जिन टास्क क्षेत्रों में दोनों मॉडल मजबूत थे, वे अलग-अलग थे
- Oracle routing ने 72~96% टास्क K3 को सौंपे, और K3 सभी 5 task groups में Fable से अधिक cost-effective रहा
- लंबे agent loops में K3 ने केवल Fable इस्तेमाल करने की तुलना में लगभग 50 गुना तक अधिक cost efficiency दिखाई, लेकिन अधिक execution steps के कारण processing time लंबा हो सकता है
- सस्ते open model को default बनाकर कठिन टास्क दूसरे मॉडल को भेजने वाला workload-customized router quality और cost दोनों को बेहतर कर सकता है
वास्तविक एजेंट टास्क से मापन
- Kimi K3 और Fable 5 को समान harness में चलाकर वास्तविक agent loop के रूप में लगभग 1,030 टास्क किए गए
- SWE: वास्तविक repositories में bug fixing जैसे 460 टास्क
- Terminal: security, cryptography, reverse engineering, system administration आदि के लंबे agent टास्क 89
- Algorithm: LeetCode और AtCoder प्रकार की 100 समस्याएं
- Multilingual: 6 भाषाओं में implementation के 225 टास्क
- Legal: वकीलों द्वारा score किए गए 120 legal agent टास्क
- कई प्रकार के टास्क पर benchmark results का औसत लेकर दोनों मॉडलों की तुलना की गई
Oracle routing का अर्थ और सीमाएं
- Oracle routing एक theoretical measurement method है, जिसमें हर टास्क को सभी मॉडलों पर चलाने के बाद सही जवाब देने वाले विकल्पों में सबसे सस्ता मॉडल चुना जाता है
- वास्तविक router टास्क को पहले से कई मॉडलों पर नहीं चला सकता, इसलिए उसे पहले ही अनुमान लगाना होता है कि cost और quality का सबसे अच्छा balance किस मॉडल में है
- इस तरीके में कुल टास्क के 72~96% के लिए K3 चुना गया
- रोजमर्रा के टास्क और ऐसे long-tail टास्क जिन्हें top-tier model चाहिए, उनके बीच फर्क करने वाला router संभव हो सकता है
- इसे साबित करने के लिए single-digit scale नहीं, बल्कि 10x स्तर का अतिरिक्त routing data और वास्तविक environment में performance validation चाहिए
Overall performance समान, लेकिन strengths अलग
- प्रमुख SWE परिणाम K3 92.4%, Fable 92.6% रहे, यानी लगभग समान
- 5 task types में भी दोनों मॉडलों के बीच अंतर आम तौर पर कुछ percentage points के भीतर था, और Fable multilingual coding range में थोड़ा आगे रहा
- समान overall scores के उलट, detailed tasks में हर मॉडल ने स्पष्ट रूप से मजबूत क्षेत्र दिखाए
टास्क क्षेत्रों के हिसाब से अंतर
- SWE को problem areas में बांटने पर K3 symbolic math और developer tools में, जबकि Fable web और data visualization टास्क में बेहतर रहा
- Multilingual टास्क में Fable Java, Python और C++ में आगे रहा, जबकि K3 JavaScript और Rust में बराबरी पर रहा
- दर्जनों बार shell manipulate करने वाले लंबे terminal टास्क में K3 ने अपनी ताकत दिखाई
- उसने 7z hash, FEAL cryptanalysis, leaked secrets, real-world vulnerabilities और out-of-control asynchronous task हल किए जिन्हें Fable हल नहीं कर सका
- Accuracy और cost की साथ-साथ तुलना में Fable multilingual में, K3 terminal और legal में आगे रहा, और बाकी में दोनों मोटे तौर पर समान रहे
Cost gap बनाने वाली संरचना
- K3 की cost advantage token price, prompt caching और प्रति-टास्क input volume से आती है
- एक SWE टास्क पर K3 ने लगभग 55 turns और 1.3 million tokens इस्तेमाल किए, जबकि Fable ने लगभग 21 turns और 130k tokens इस्तेमाल किए
- लंबे terminal टास्क में उल्टा Fable ने लगभग 64 turns और 1.5 million tokens तक इस्तेमाल किए और कभी-कभी timeout तक पहुंचा
- SWE में K3 ने 10 गुना अधिक tokens पढ़े, फिर भी prompt cache hit के कारण execution cost Fable से कम रही
- Execution steps बढ़ने पर वास्तविक processing time लंबा हो सकता है
- जिन टास्क में 2 seconds के भीतर जवाब चाहिए, उनमें latency महत्वपूर्ण है
- बड़े scale के background agents में कम billing cost अधिक महत्वपूर्ण हो जाती है
दोनों मॉडलों को मिलाने का परिणाम
- हर टास्क को अधिक उपयुक्त मॉडल को भेजने पर दोनों मॉडलों के बीच का औसत नहीं, बल्कि हर single model से बेहतर performance मिल सकती है
- Task-level oracle routing ने individual model execution से हमेशा बेहतर performance दिखाई, और overall accuracy 93% तक पहुंची
- 72~96% traffic को cost-optimized model K3 पर भेजते हुए भी overall quality हर मॉडल से बेहतर रही, और cost K3-only usage के करीब हो गई
- K3 सभी 5 task groups में Fable से अधिक cost-effective रहा, और लंबे agent loops में लगभग 50 गुना तक अधिक cost efficiency दर्ज की
Single model से बेहतर workload-specific routing
- Kimi K3 और Fable को साथ में route करने से अलग-अलग strengths का फायदा उठाते हुए cost घटाई जा सकती है
- हर मॉडल की pricing और specialty अलग होती है, इसलिए सबसे अच्छी quality वाला AI किसी single provider के बजाय कई मॉडलों के combination से आ सकता है
- K3 जैसे open model को default option बनाया जा सकता है, जिसकी cost 50 गुना तक कम है और जिसे oracle ने ज्यादातर traffic सौंपा
- Router को वास्तविक workload के अनुसार ढालना चाहिए, और टास्क व मॉडल के fit को लगातार सीखते रहना चाहिए
1 टिप्पणियां
Hacker News टिप्पणियाँ
इन्हें खुद चलाकर और परखकर देखें तो ये सभी मॉडल benchmark पर overfit दिखते हैं। किसी metric में भले frontier models के करीब लगें, लेकिन असली काम में बिखर जाते हैं और token efficiency भी बेहूदा रूप से कम है
Fireworks को बंद मॉडल्स के विपरीत K3 hosting से बड़ा फायदा मिलता है, इसलिए ऐसे शीर्षक लगाने की उसकी प्रेरणा बहुत बड़ी है
फिर भी ये पिछली पीढ़ी के शीर्ष मॉडल्स Opus 4.8·GPT 5.5 के लगभग बराबर हैं, और https://senko.net/vibecode-bench/ पर भी तुलना की जा सकती है
official API और उनके-अपने coding tools का इस्तेमाल करके, सिर्फ विस्तृत specs के आधार पर एक सरल लेकिन आसान न होने वाला web app बनवाया गया तो user testing में K3·Qwen 3.8·Fable के नतीजे लगभग समान थे, और Sol की code review में भी सबने मानक पूरा किया, जिसमें Fable थोड़ा आगे था
व्यावहारिक काम में मैं अब भी Opus 4.8 और Sol को पसंद करता हूँ, लेकिन अगर विकल्प चाहिए तो K3 और Qwen 3.8 भी काफ़ी उपयोगी हैं
coding क्षमता का मूल्यांकन मुख्यतः ऐसे open-ended multi-agent environment में किया जाता है जहाँ answer set नहीं होता और agents एक-दूसरे को प्रभावित करते हैं; यहाँ Chinese models आम तौर पर अपने प्रचारित model card की तुलना में US models के मुकाबले कमतर निकलते हैं
Kimi K3 असाधारण रूप से सचमुच frontier के क़रीब है, लेकिन बहुत धीमा है। Muse Spark 1.1, Fable और Sol के बाद सबसे मजबूत है और cost efficiency भी सबसे अच्छी है, इसलिए Llama 4 के बाद बड़ा उलटफेर हुआ है। डेटा https://gertlabs.com/rankings पर है
code quality मेरे लिखे जाने वाले स्तर के बराबर है, और जिन क्षेत्रों में मैं सहज नहीं हूँ वहाँ इससे बेहतर है। refactoring, integration·regression testing, audit log और error notification जाँच जैसे काम, जिन्हें इंसान टाल देते हैं या उबाऊ मानते हैं, यह लगातार करता है, जिससे कुल software engineering स्तर ऊँचा होता है
यह PostgreSQL इस्तेमाल करने वाली अपेक्षाकृत जटिल Ruby on Rails की live service है; $200 प्रति माह वाले Max प्लान में token budget समस्या नहीं था और लागत पूरी तरह वाजिब लगी
यह दिलचस्प है कि लगभग 1,000 tasks को software engineering, law आदि 5 क्षेत्रों में बाँटकर Kimi K3 और Fable का परीक्षण किया गया
वे सामने एक router model रखते हैं जो अनुमान लगाता है कि सही उत्तर देने में कौन-सा मॉडल सस्ता पड़ेगा, और अंततः मेरा मानना है कि उसे अपने-अपने workload पर लगातार train किया जाना चाहिए
router ने क्षेत्र के अनुसार 72~96% tasks में Kimi को चुना, और क्षेत्र के हिसाब से 1.5~50 गुना लागत बचत हासिल की
यह सिर्फ़ Fireworks की यह धारणा है कि अगर पहले से ऐसा router मौजूद हो जो वही परिणाम predict कर सके, तो लागत बचाई जा सकती है; उसका वास्तव में मौजूद होना ही बड़ी पूर्वधारणा है
अगर कोई मॉडल इंसानों की तरह बात करता हो, तो मैं benchmark score में 5% गिरावट भी स्वीकार कर सकता हूँ
LOLकहना सिर्फ़ हास्यास्पद ही नहीं, नुकसानदेह भी हैउदाहरण के लिए, उसने एक लंबे paper guide को “अभी एक बार सरसरी निगाह से देखो और Part II पढ़ते समय फिर संदर्भ लो” जैसे आज्ञार्थक टुकड़ों, bold keywords और arrows से ठूँस-ठूँसकर जोड़े गए एक ही line output में बदल दिया
Anthropic तेज़ गति से चलाए गए रोमन साम्राज्य जैसा दिख रहा है, मानो IPO करने से पहले ही अपनी चोटी पार कर पतन के दौर में दाखिल हो गया हो
यह जानना है कि Kimi K3 coding plan को subscribe करते समय data governance और privacy protection कैसे लागू होते हैं। Anthropic से migrate करना चाहता/चाहती हूँ
Claude के विपरीत, model training के लिए opt-out का विकल्प नहीं है, और terms के अनुसार Kimi ग्राहक के code का उपयोग training में कर सकता है
अगर आप Chinese vendors से सीधे deal नहीं करना चाहते, तो AtlasCode $20/month, OpenCode Go $10/month, और Cline Pass $10/month कुछ लोकप्रिय public weight models पर 2~6x usage देते हैं
निजी तौर पर, मैं Z.ai को $17/month पर subscribe करता/करती हूँ और MiMo v2.5, Hy3, Qwen 3.7 Plus, DeepSeek v4 के लिए सीधे उनके original providers को API fees देता/देती हूँ
सोच रहा/रही हूँ कि क्या public models को push करने के लिए पैसे लेकर ऐसी पोस्ट लिखी जा सकती है, और अगर हाँ तो उसका उद्देश्य क्या है
आधुनिक SaaS products में FastAPI·Python और Spring Boot·Java पर काम करने के मेरे अनुभव में, अच्छा और efficient public model सिर्फ Qwen 3.7 Max था
GLM 5.2 और Kimi code लिखने से पहले लगभग 70k~80k tokens तक codebase search करते हैं और फिर भी अक्सर code तोड़ देते हैं। 1 साल पहले की तरह इन्हें बहुत detailed specs देनी पड़ती हैं, जबकि Qwen 3.7 बिना ज़्यादा मेहनत के काम पूरा कर देता है
यह जानना है कि यहाँ Kimi में ऐसा क्या खास बेहतर है। मेरी जानकारी में इसकी कीमत Sonnet 5 जैसी है, तो फिर Sonnet 5 और Fable का इस्तेमाल करने या उससे सस्ता Grok 4.5 लेने पर क्या होगा?
मुझे Chinese models बहुत पसंद हैं और मैं सिर्फ DeepSeek का इस्तेमाल करता/करती हूँ, और अब Kimi K3 को भी advanced coding tasks के लिए एक बेहतरीन planning assistant की तरह उपयोग करता/करती हूँ
DeepSeek v4 Flash बहुत तेज़ है और Rust, PostgreSQL, Angular, Terraform में दिए गए लगभग सभी tasks संभाल लेता है
मैं Bifrost को LLM gateway के रूप में self-host करता/करती हूँ, लेकिन चाहता/चाहती हूँ कि vendors prepaid top-up और auto-recharge की बजाय VPS की तरह monthly/daily actual usage के आधार पर automatic billing करें। कई vendors के पास non-refundable minimum balance रखने के बजाय मैं सिर्फ जितना इस्तेमाल करूँ उतना ही भुगतान करना चाहता/चाहती हूँ
OpenRouter मददगार है, लेकिन उसकी service और extra fees पसंद नहीं हैं
Kimi k2.5/6 धीमा है, performance भी खराब हुई है, और
engine overloadederrors भी बढ़ गए हैं। k3 लंबे समय तक सोचता है, लेकिन output में कोई साफ़ सुधार नहीं दिखता। मुझे लगता है कि compute pressure की वजह से शायद model को अस्थायी रूप से quantize किया गया होहाल में मैं ज़्यादातर DeepSeek v4 Pro का उपयोग करता/करती हूँ, और जब powerful model चाहिए होता है तब GPT 5.5 लेता/लेती हूँ। GLM 5.2 कुछ tasks में अच्छा था, लेकिन दूसरे tasks में बहुत खराब, और Google या Anthropic के models अभी तक प्रभावित नहीं कर पाए
OpenRouter लगभग हर model को release के पहले दिन से उपलब्ध करा देता है, लेकिन Bifrost का आकर्षण यह है कि बाद में OpenRouter छोड़ने पर भी बाकी tech stack को छूने की ज़रूरत नहीं पड़ेगी। अगर self-hosting व्यावहारिक हो जाए, तो OpenAI·Anthropic·OpenRouter पर निर्भरता कम की जा सकती है, और जिस model पर निर्भर थे उसके अचानक discontinue होने का जोखिम भी घटता है
यह ऐसी स्थिति है जहाँ कोई public model hosting company कह रही है कि public models बेहतरीन हैं
जैसा कि लेख में बताया गया है, मैं routing tool या Claude Code के साथ इस्तेमाल किए जा सकने वाले किसी अन्य अच्छे routing platform की तलाश में हूँ। मुझे पता है कि इस लेख का router Oracle-style है
हर भूमिका के लिए कई providers के अनुशंसित LLM rankings हैं, और उदाहरण के लिए
Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5)को मुख्य orchestrator के रूप में इस्तेमाल किया जाता है