1 पॉइंट द्वारा GN⁺ 4 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • लगभग 1,030 एजेंट टास्क पर Kimi K3 और Fable 5 की तुलना में, टास्क-आधारित routing ने 93% accuracy के साथ अलग-अलग मॉडलों से बेहतर quality हासिल की
  • SWE, terminal, algorithm, multilingual और legal टास्क में overall performance समान रही, लेकिन जिन टास्क क्षेत्रों में दोनों मॉडल मजबूत थे, वे अलग-अलग थे
  • Oracle routing ने 72~96% टास्क K3 को सौंपे, और K3 सभी 5 task groups में Fable से अधिक cost-effective रहा
  • लंबे agent loops में K3 ने केवल Fable इस्तेमाल करने की तुलना में लगभग 50 गुना तक अधिक cost efficiency दिखाई, लेकिन अधिक execution steps के कारण processing time लंबा हो सकता है
  • सस्ते open model को default बनाकर कठिन टास्क दूसरे मॉडल को भेजने वाला workload-customized router quality और cost दोनों को बेहतर कर सकता है

वास्तविक एजेंट टास्क से मापन

  • Kimi K3 और Fable 5 को समान harness में चलाकर वास्तविक agent loop के रूप में लगभग 1,030 टास्क किए गए
    • SWE: वास्तविक repositories में bug fixing जैसे 460 टास्क
    • Terminal: security, cryptography, reverse engineering, system administration आदि के लंबे agent टास्क 89
    • Algorithm: LeetCode और AtCoder प्रकार की 100 समस्याएं
    • Multilingual: 6 भाषाओं में implementation के 225 टास्क
    • Legal: वकीलों द्वारा score किए गए 120 legal agent टास्क
  • कई प्रकार के टास्क पर benchmark results का औसत लेकर दोनों मॉडलों की तुलना की गई

Oracle routing का अर्थ और सीमाएं

  • Oracle routing एक theoretical measurement method है, जिसमें हर टास्क को सभी मॉडलों पर चलाने के बाद सही जवाब देने वाले विकल्पों में सबसे सस्ता मॉडल चुना जाता है
  • वास्तविक router टास्क को पहले से कई मॉडलों पर नहीं चला सकता, इसलिए उसे पहले ही अनुमान लगाना होता है कि cost और quality का सबसे अच्छा balance किस मॉडल में है
  • इस तरीके में कुल टास्क के 72~96% के लिए K3 चुना गया
  • रोजमर्रा के टास्क और ऐसे long-tail टास्क जिन्हें top-tier model चाहिए, उनके बीच फर्क करने वाला router संभव हो सकता है
    • इसे साबित करने के लिए single-digit scale नहीं, बल्कि 10x स्तर का अतिरिक्त routing data और वास्तविक environment में performance validation चाहिए

Overall performance समान, लेकिन strengths अलग

  • प्रमुख SWE परिणाम K3 92.4%, Fable 92.6% रहे, यानी लगभग समान
  • 5 task types में भी दोनों मॉडलों के बीच अंतर आम तौर पर कुछ percentage points के भीतर था, और Fable multilingual coding range में थोड़ा आगे रहा
  • समान overall scores के उलट, detailed tasks में हर मॉडल ने स्पष्ट रूप से मजबूत क्षेत्र दिखाए

टास्क क्षेत्रों के हिसाब से अंतर

  • SWE को problem areas में बांटने पर K3 symbolic math और developer tools में, जबकि Fable web और data visualization टास्क में बेहतर रहा
  • Multilingual टास्क में Fable Java, Python और C++ में आगे रहा, जबकि K3 JavaScript और Rust में बराबरी पर रहा
  • दर्जनों बार shell manipulate करने वाले लंबे terminal टास्क में K3 ने अपनी ताकत दिखाई
    • उसने 7z hash, FEAL cryptanalysis, leaked secrets, real-world vulnerabilities और out-of-control asynchronous task हल किए जिन्हें Fable हल नहीं कर सका
  • Accuracy और cost की साथ-साथ तुलना में Fable multilingual में, K3 terminal और legal में आगे रहा, और बाकी में दोनों मोटे तौर पर समान रहे

Cost gap बनाने वाली संरचना

  • K3 की cost advantage token price, prompt caching और प्रति-टास्क input volume से आती है
  • एक SWE टास्क पर K3 ने लगभग 55 turns और 1.3 million tokens इस्तेमाल किए, जबकि Fable ने लगभग 21 turns और 130k tokens इस्तेमाल किए
  • लंबे terminal टास्क में उल्टा Fable ने लगभग 64 turns और 1.5 million tokens तक इस्तेमाल किए और कभी-कभी timeout तक पहुंचा
  • SWE में K3 ने 10 गुना अधिक tokens पढ़े, फिर भी prompt cache hit के कारण execution cost Fable से कम रही
  • Execution steps बढ़ने पर वास्तविक processing time लंबा हो सकता है
    • जिन टास्क में 2 seconds के भीतर जवाब चाहिए, उनमें latency महत्वपूर्ण है
    • बड़े scale के background agents में कम billing cost अधिक महत्वपूर्ण हो जाती है

दोनों मॉडलों को मिलाने का परिणाम

  • हर टास्क को अधिक उपयुक्त मॉडल को भेजने पर दोनों मॉडलों के बीच का औसत नहीं, बल्कि हर single model से बेहतर performance मिल सकती है
  • Task-level oracle routing ने individual model execution से हमेशा बेहतर performance दिखाई, और overall accuracy 93% तक पहुंची
  • 72~96% traffic को cost-optimized model K3 पर भेजते हुए भी overall quality हर मॉडल से बेहतर रही, और cost K3-only usage के करीब हो गई
  • K3 सभी 5 task groups में Fable से अधिक cost-effective रहा, और लंबे agent loops में लगभग 50 गुना तक अधिक cost efficiency दर्ज की

Single model से बेहतर workload-specific routing

  • Kimi K3 और Fable को साथ में route करने से अलग-अलग strengths का फायदा उठाते हुए cost घटाई जा सकती है
  • हर मॉडल की pricing और specialty अलग होती है, इसलिए सबसे अच्छी quality वाला AI किसी single provider के बजाय कई मॉडलों के combination से आ सकता है
  • K3 जैसे open model को default option बनाया जा सकता है, जिसकी cost 50 गुना तक कम है और जिसे oracle ने ज्यादातर traffic सौंपा
  • Router को वास्तविक workload के अनुसार ढालना चाहिए, और टास्क व मॉडल के fit को लगातार सीखते रहना चाहिए

1 टिप्पणियां

 
GN⁺ 4 시간 전
Hacker News टिप्पणियाँ
  • इन्हें खुद चलाकर और परखकर देखें तो ये सभी मॉडल benchmark पर overfit दिखते हैं। किसी metric में भले frontier models के करीब लगें, लेकिन असली काम में बिखर जाते हैं और token efficiency भी बेहूदा रूप से कम है
    Fireworks को बंद मॉडल्स के विपरीत K3 hosting से बड़ा फायदा मिलता है, इसलिए ऐसे शीर्षक लगाने की उसकी प्रेरणा बहुत बड़ी है

    • कुछ दिनों तक K3, Qwen 3.8 Max Preview, Fable और Sol को परखने के बाद मैं इस बात से कुछ हद तक सहमत हूँ कि benchmark पर भरोसा करना मुश्किल है और Chinese models धीमे हैं तथा token efficiency भी कम है
      फिर भी ये पिछली पीढ़ी के शीर्ष मॉडल्स Opus 4.8·GPT 5.5 के लगभग बराबर हैं, और https://senko.net/vibecode-bench/ पर भी तुलना की जा सकती है
      official API और उनके-अपने coding tools का इस्तेमाल करके, सिर्फ विस्तृत specs के आधार पर एक सरल लेकिन आसान न होने वाला web app बनवाया गया तो user testing में K3·Qwen 3.8·Fable के नतीजे लगभग समान थे, और Sol की code review में भी सबने मानक पूरा किया, जिसमें Fable थोड़ा आगे था
      व्यावहारिक काम में मैं अब भी Opus 4.8 और Sol को पसंद करता हूँ, लेकिन अगर विकल्प चाहिए तो K3 और Qwen 3.8 भी काफ़ी उपयोगी हैं
    • सब benchmark पर overfit हैं, लेकिन असली बात यह है कि एक-दूसरे की तुलना में कितना overfit हैं
      coding क्षमता का मूल्यांकन मुख्यतः ऐसे open-ended multi-agent environment में किया जाता है जहाँ answer set नहीं होता और agents एक-दूसरे को प्रभावित करते हैं; यहाँ Chinese models आम तौर पर अपने प्रचारित model card की तुलना में US models के मुकाबले कमतर निकलते हैं
      Kimi K3 असाधारण रूप से सचमुच frontier के क़रीब है, लेकिन बहुत धीमा है। Muse Spark 1.1, Fable और Sol के बाद सबसे मजबूत है और cost efficiency भी सबसे अच्छी है, इसलिए Llama 4 के बाद बड़ा उलटफेर हुआ है। डेटा https://gertlabs.com/rankings पर है
    • Fable काफ़ी बड़े codebase में भी बहुत अच्छा काम करता है। कुछ बार उसे सुधारना या दिशा देनी पड़ी, लेकिन ज़्यादातर इसलिए क्योंकि prompt की requirements पर्याप्त नहीं थीं; वास्तव में वह सिर्फ़ लगभग दो बार ही गलत था, इसलिए इसकी error rate मेरे पूरे करियर से कम है
      code quality मेरे लिखे जाने वाले स्तर के बराबर है, और जिन क्षेत्रों में मैं सहज नहीं हूँ वहाँ इससे बेहतर है। refactoring, integration·regression testing, audit log और error notification जाँच जैसे काम, जिन्हें इंसान टाल देते हैं या उबाऊ मानते हैं, यह लगातार करता है, जिससे कुल software engineering स्तर ऊँचा होता है
      यह PostgreSQL इस्तेमाल करने वाली अपेक्षाकृत जटिल Ruby on Rails की live service है; $200 प्रति माह वाले Max प्लान में token budget समस्या नहीं था और लागत पूरी तरह वाजिब लगी
    • लेख नहीं पढ़ा, लेकिन inference service कंपनी का अपने यहाँ उपलब्ध Mythos-स्तर के मॉडल को आगे रखकर शीर्षक बनाना शुरू से ही संदिग्ध लगा। Kimi K3 से एक-तिहाई से भी कम parameters वाला GLM 5.2 अब भी मुख्य मॉडल है
    • इन सभी आकलनों के साथ फ़िलहाल के लिए जैसी शर्त जोड़ना ज़रूरी है। रुझान को देखें तो, भले अभी coding के लिए पर्याप्त अच्छे स्तर पर न पहुँचे हों, लेकिन जल्द पहुँचेंगे; और हमें उस दुनिया के लिए तैयार रहना चाहिए जहाँ open models लगभग सारे software tasks कर सकें
  • यह दिलचस्प है कि लगभग 1,000 tasks को software engineering, law आदि 5 क्षेत्रों में बाँटकर Kimi K3 और Fable का परीक्षण किया गया
    वे सामने एक router model रखते हैं जो अनुमान लगाता है कि सही उत्तर देने में कौन-सा मॉडल सस्ता पड़ेगा, और अंततः मेरा मानना है कि उसे अपने-अपने workload पर लगातार train किया जाना चाहिए
    router ने क्षेत्र के अनुसार 72~96% tasks में Kimi को चुना, और क्षेत्र के हिसाब से 1.5~50 गुना लागत बचत हासिल की

    • यहाँ router, दोनों मॉडलों को चलाकर pass/fail जाँचने के बाद सस्ता मॉडल चुनने वाला oracle baseline है
      यह सिर्फ़ Fireworks की यह धारणा है कि अगर पहले से ऐसा router मौजूद हो जो वही परिणाम predict कर सके, तो लागत बचाई जा सकती है; उसका वास्तव में मौजूद होना ही बड़ी पूर्वधारणा है
    • इसी तरह के router कई हैं, जैसे https://openrouter.ai/openrouter/auto
  • अगर कोई मॉडल इंसानों की तरह बात करता हो, तो मैं benchmark score में 5% गिरावट भी स्वीकार कर सकता हूँ

    • मुझे तो उल्टा ऐसे मॉडल ज़्यादा पसंद हैं जो इंसानों की तरह बोलने की कोशिश न करें
    • 5% छोड़ने की ज़रूरत ही नहीं; Fable के output को Gemini Flash में डालकर उसे ज़्यादा पढ़ने-लायक वाक्यों में फिर से लिखवाया जा सकता है
    • मैं ज़ोरदार रूप से पसंद करता हूँ कि मॉडल मेरी इंसानी बोलचाल की नकल न करे। Claude का दोस्त जैसा बर्ताव करना और मज़ाक के जवाब में LOL कहना सिर्फ़ हास्यास्पद ही नहीं, नुकसानदेह भी है
    • Opus डिफ़ॉल्ट रूप से उसी शैली में output देता है जिसे मैं Claude-भाषा कहता हूँ। यह जरूरत से ज़्यादा सरल बनाई गई और व्याकरण की दृष्टि से अधूरी पंक्तियाँ होती हैं, जिन्हें पढ़ना कष्टदायक है; मॉडल के लिए शायद पढ़ना-लिखना आसान हो, लेकिन इंसानों के लिए नहीं
      उदाहरण के लिए, उसने एक लंबे paper guide को “अभी एक बार सरसरी निगाह से देखो और Part II पढ़ते समय फिर संदर्भ लो” जैसे आज्ञार्थक टुकड़ों, bold keywords और arrows से ठूँस-ठूँसकर जोड़े गए एक ही line output में बदल दिया
    • LLM इंसान नहीं है, तो उसे ज़बरदस्ती इंसानों की तरह बोलने की कोई वजह नहीं
  • Anthropic तेज़ गति से चलाए गए रोमन साम्राज्य जैसा दिख रहा है, मानो IPO करने से पहले ही अपनी चोटी पार कर पतन के दौर में दाखिल हो गया हो

  • यह जानना है कि Kimi K3 coding plan को subscribe करते समय data governance और privacy protection कैसे लागू होते हैं। Anthropic से migrate करना चाहता/चाहती हूँ

    • https://platform.kimi.ai/docs/agreement/modeluse के अनुसार, content का उपयोग service प्रदान करने, बनाए रखने, विकसित करने और सुधारने आदि के लिए किया जा सकता है, और जिन ग्राहकों को training restrictions चाहिए उन्हें अलग enterprise contract या written agreement पर चर्चा करनी होगी
      Claude के विपरीत, model training के लिए opt-out का विकल्प नहीं है, और terms के अनुसार Kimi ग्राहक के code का उपयोग training में कर सकता है
    • जब तक western providers इसे host करना शुरू न करें, तब तक इंतज़ार करना पड़ेगा
    • सबसे आसान तरीका OpenRouter पर sign up करना है और उन सभी providers को exclude करना है जो zero data retention (ZDR) नहीं देते। हालांकि API pricing coding plan से महंगी हो सकती है, और MiniMax के $20/month plan में मिलने वाले 1.7 billion tokens, input/output·cache ratio के अनुसार, API आधार पर $200~$500+ के बराबर मूल्य रखते हैं
      अगर आप Chinese vendors से सीधे deal नहीं करना चाहते, तो AtlasCode $20/month, OpenCode Go $10/month, और Cline Pass $10/month कुछ लोकप्रिय public weight models पर 2~6x usage देते हैं
      निजी तौर पर, मैं Z.ai को $17/month पर subscribe करता/करती हूँ और MiMo v2.5, Hy3, Qwen 3.7 Plus, DeepSeek v4 के लिए सीधे उनके original providers को API fees देता/देती हूँ
    • privacy terms https://www.kimi.com/user/agreement/zh/userPrivacy पर देखे जा सकते हैं
  • सोच रहा/रही हूँ कि क्या public models को push करने के लिए पैसे लेकर ऐसी पोस्ट लिखी जा सकती है, और अगर हाँ तो उसका उद्देश्य क्या है
    आधुनिक SaaS products में FastAPI·Python और Spring Boot·Java पर काम करने के मेरे अनुभव में, अच्छा और efficient public model सिर्फ Qwen 3.7 Max था
    GLM 5.2 और Kimi code लिखने से पहले लगभग 70k~80k tokens तक codebase search करते हैं और फिर भी अक्सर code तोड़ देते हैं। 1 साल पहले की तरह इन्हें बहुत detailed specs देनी पड़ती हैं, जबकि Qwen 3.7 बिना ज़्यादा मेहनत के काम पूरा कर देता है

    • यह अच्छा content marketing है। Fireworks एक बड़ा model inference provider है जो Kimi K3 access बेचता है
    • Fireworks public models को तेज़ी से चलाने में विशेषज्ञ है, और उसकी ज़्यादातर revenue Chinese models से आती है, इसलिए economic incentive ही उसका पूरा business model है
    • tech influence business में बहुत पैसा है, लेकिन ज़्यादातर बड़े vendors से आता है, जैसे OpenAI का tbpn acquisition या कुछ influencers के लिए early access
    • Lin Qiao Fireworks AI के co-founder और CEO हैं। LLM, US-China cold war की space race जैसा है, इसलिए संभव है कि पैसे से ज़्यादा राष्ट्रीय/सभ्यतागत श्रेष्ठता साबित करने की प्रेरणा काम कर रही हो
  • यह जानना है कि यहाँ Kimi में ऐसा क्या खास बेहतर है। मेरी जानकारी में इसकी कीमत Sonnet 5 जैसी है, तो फिर Sonnet 5 और Fable का इस्तेमाल करने या उससे सस्ता Grok 4.5 लेने पर क्या होगा?

    • पोस्ट में कहा गया है कि Kimi कुछ tasks में Fable से बेहतर है, लेकिन शायद Sonnet पर यह लागू नहीं होता
    • public models का फायदा यह है कि बड़े enterprise उन्हें अपने data center में local run और fine-tuning के साथ चला सकते हैं
  • मुझे Chinese models बहुत पसंद हैं और मैं सिर्फ DeepSeek का इस्तेमाल करता/करती हूँ, और अब Kimi K3 को भी advanced coding tasks के लिए एक बेहतरीन planning assistant की तरह उपयोग करता/करती हूँ
    DeepSeek v4 Flash बहुत तेज़ है और Rust, PostgreSQL, Angular, Terraform में दिए गए लगभग सभी tasks संभाल लेता है
    मैं Bifrost को LLM gateway के रूप में self-host करता/करती हूँ, लेकिन चाहता/चाहती हूँ कि vendors prepaid top-up और auto-recharge की बजाय VPS की तरह monthly/daily actual usage के आधार पर automatic billing करें। कई vendors के पास non-refundable minimum balance रखने के बजाय मैं सिर्फ जितना इस्तेमाल करूँ उतना ही भुगतान करना चाहता/चाहती हूँ
    OpenRouter मददगार है, लेकिन उसकी service और extra fees पसंद नहीं हैं

    • इन दिनों मैं मुख्य रूप से DeepSeek v4 Pro इस्तेमाल करता/करती हूँ, और जब बहुत parallel work होता है तो speed कम महत्वपूर्ण होती है। अगर यह fail हो जाए, तो बातचीत के बीच GPT 5.5 पर switch करके उससे issue find करने को कहता/कहती हूँ, फिर उसका analysis context में छोड़कर वापस DeepSeek पर आ जाता/आती हूँ
      Kimi k2.5/6 धीमा है, performance भी खराब हुई है, और engine overloaded errors भी बढ़ गए हैं। k3 लंबे समय तक सोचता है, लेकिन output में कोई साफ़ सुधार नहीं दिखता। मुझे लगता है कि compute pressure की वजह से शायद model को अस्थायी रूप से quantize किया गया हो
      हाल में मैं ज़्यादातर DeepSeek v4 Pro का उपयोग करता/करती हूँ, और जब powerful model चाहिए होता है तब GPT 5.5 लेता/लेती हूँ। GLM 5.2 कुछ tasks में अच्छा था, लेकिन दूसरे tasks में बहुत खराब, और Google या Anthropic के models अभी तक प्रभावित नहीं कर पाए
    • अगर आप reasonix या whale जैसे tools इस्तेमाल करें, तो cache hit rate लगभग 98% तक पहुँच सकती है, जिससे request cost लगभग मुफ्त जैसी हो जाती है। यह Cloudflare या DigitalOcean जैसे बिना subsidy वाले US providers पर भी संभव है
    • prepaid model इस बात से बचाता है कि users inference resources बहुत ज़्यादा consume करके card cancel कर दें और गायब हो जाएँ। VPS एक long-term investment है, इसलिए switch करना कठिन होता है, और कुछ users अगर एक महीने का bill नहीं भी दें, तो provider की cost तुलनात्मक रूप से कम रहती है
    • मैं Bifrost देख रहा/रही हूँ, इसलिए जानना है कि आपने LLM gateway क्यों चुना
      OpenRouter लगभग हर model को release के पहले दिन से उपलब्ध करा देता है, लेकिन Bifrost का आकर्षण यह है कि बाद में OpenRouter छोड़ने पर भी बाकी tech stack को छूने की ज़रूरत नहीं पड़ेगी। अगर self-hosting व्यावहारिक हो जाए, तो OpenAI·Anthropic·OpenRouter पर निर्भरता कम की जा सकती है, और जिस model पर निर्भर थे उसके अचानक discontinue होने का जोखिम भी घटता है
    • extra fees के अलावा OpenRouter service की कौन-सी बात पसंद नहीं है, यह जानना है
  • यह ऐसी स्थिति है जहाँ कोई public model hosting company कह रही है कि public models बेहतरीन हैं

    • उन्होंने methodology और results सार्वजनिक किए, और मुझे Kimi और Fable की relative strengths और weaknesses पता चलीं, जो मैंने कहीं और नहीं देखीं। सिर्फ इसलिए कि वे model hosting business चलाते हैं, इसका मतलब यह नहीं कि उन्हें results साझा करने का अधिकार नहीं है
    • Fireworks सिर्फ public weight models ही host नहीं करता, और सिर्फ इसलिए कि बड़ी खबर नए customers ला सकती है, इसका मतलब यह नहीं कि content झूठा है
    • जिसने इन्हें खुद इस्तेमाल किया है, वह जानता होगा कि उनका आकलन सही है
  • जैसा कि लेख में बताया गया है, मैं routing tool या Claude Code के साथ इस्तेमाल किए जा सकने वाले किसी अन्य अच्छे routing platform की तलाश में हूँ। मुझे पता है कि इस लेख का router Oracle-style है

    • https://github.com/code-yeongyu/oh-my-openagent मूल लेख के Oracle pattern को 11 भूमिकाओं में लागू करता है
      हर भूमिका के लिए कई providers के अनुशंसित LLM rankings हैं, और उदाहरण के लिए Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5) को मुख्य orchestrator के रूप में इस्तेमाल किया जाता है