- रोज़मर्रा के coding कामों में Kimi K3 और Claude को साथ इस्तेमाल करने पर, output quality और जवाब के लिए ज़रूरी token की संख्या में व्यावहारिक फर्क पहचानना मुश्किल था
- Kimi K3 API की कीमत input के लिए प्रति 10 लाख token $3 और output के लिए $15 है, जो क्रमशः $10 और $50 वाले Claude के top-tier model से काफ़ी सस्ती है
- Kimi की शुरुआत $19 प्रति माह से होती है और $39 प्रति माह coding tier भी काफ़ी उदार है, जबकि Claude में agent work के दौरान usage limit जल्दी खत्म हो जाती है और $20 प्रति माह प्लान पर Fable access भी बना नहीं रह सका
- Semgrep के cyber security benchmark में, जहां सीमित Claude ने कुछ काम ठुकरा दिए, वहीं GLM 5.2 ने वे काम पूरे किए और आगे निकल गया; यह MIT license के तहत जारी है और नवीनतम Opus से सस्ता भी है
- सिर्फ़ अमेरिकी models पर लागू पाबंदियां अमेरिकी ग्राहकों के विकल्प घटाती हैं, लेकिन विदेशी open models की प्रतिस्पर्धा नहीं रोक पातीं; इसलिए जब quality मिलती-जुलती हो और कीमत कम हो, तो Kimi K3 के रहते Claude का भुगतान जारी रखने की वजह कम हो जाती है
Kimi K3 और Claude की quality·price तुलना
- Kimi K3 को सामान्य coding कामों में Claude के साथ इस्तेमाल करने पर एक जैसे काम और output quality, और लगभग समान token usage देखा गया
- यह उस उम्मीद से अलग था कि open models के नतीजे ज़्यादा बेतरतीब होंगे या वही जवाब पाने के लिए ज़्यादा token खर्च होंगे
- API कीमत में Kimi K3 input के लिए प्रति 10 लाख token $3 और output के लिए प्रति 10 लाख token $15 लेता है
- Claude का top-tier model इसी इकाई पर क्रमशः $10 और $50 है
- Kimi का paid plan $19 प्रति माह से शुरू होता है, और $39 प्रति माह वाला coding tier समान कीमत वाले Claude products की तुलना में ज़्यादा usage देता है
- Claude plans में usage limit काफ़ी सख्त है, इसलिए सामान्य agent work में भी दोपहर के खाने से पहले quota खत्म हो सकता है
- Claude $20 प्रति माह प्लान पर Fable access बनाए नहीं रख सका, इसलिए उसे बंद कर Opus पर स्विच किया गया, जबकि Kimi tier में ऐसी शर्त नहीं है
अमेरिकी AI नीति और open model प्रतिस्पर्धा
- अमेरिकी सरकार ने Fable की release में देरी कराई, और अंतिम model पर भी कई तरह के tasks को अस्वीकार करने वाली सीमाएं लागू रहीं; इसके विपरीत, चीन की labs के frontier-grade open models डाउनलोड किए जा सकते हैं, इसलिए वे अमेरिकी सरकारी regulation की पहुंच से बाहर हैं
- Semgrep के cyber security benchmark में GLM 5.2, Claude से आगे रहा
- सीमित model ने tasks ठुकराए, लेकिन open model ने उन्हें पूरा किया, और इसी फर्क ने नतीजों को प्रभावित किया
- GLM 5.2 MIT license के तहत जारी किया गया है, और खुद को frontier model कहकर पेश न करने के बावजूद, वास्तविक कामों में यह नवीनतम Opus से बेहतर नतीजे देता है और इसकी लागत भी काफ़ी कम है
- OpenAI का GPT-5.6 भी सरकारी प्रतिबंध प्रक्रिया से गुज़रा, लेकिन OpenAI अपने मुख्य model को $20 प्रति माह प्लान में दे सकता है, इसलिए उसके पास Anthropic की तुलना में ज़्यादा गुंजाइश है
- आगे चलकर अमेरिकी सरकार automobile industry में इस्तेमाल किए गए subsidy, bailout, protective tariff जैसे तरीकों को AI और open source पर लागू कर सकती है
- public-private partnership के ज़रिए वह ऐसे घरेलू models को support कर सकती है जो सिर्फ़ अमेरिका के भीतर इस्तेमाल हों और अंतरराष्ट्रीय स्तर पर प्रतिस्पर्धी न हों
- नतीजतन, अमेरिकी users को best quality या lowest price के बजाय घरेलू models खरीदने पड़ सकते हैं, और वे सबसे अच्छे models सबसे अच्छी कीमत पर इस्तेमाल नहीं कर पाएंगे
1 टिप्पणियां
Hacker News की राय
चाहे distillation के ज़रिए इसी स्तर का प्रदर्शन हासिल किया गया हो या शुरुआत से स्वतंत्र रूप से विकसित किया गया हो, अमेरिकी frontier labs का नतीजा शुरू से ही लगभग तय था। Distillation कोई हमला नहीं है, और frontier labs ने भी इंसानों द्वारा लिखे ज्ञान को models में distill किया है, इसलिए बाद में आने वाली labs का उसे और सस्ते models में compress करना एक स्वाभाविक क्रम है
बातचीत को सेव करके उसे अपने model training में इस्तेमाल होने से वास्तव में रोकने का कोई व्यावहारिक तरीका भी नहीं है, इसलिए model कंपनियों की बजाय hardware कंपनियों में निवेश करना बेहतर लगता है
सिर्फ़ 6 महीने पहले तक भी बहुत से लोग मानते थे कि अगर model outputs को training data की तरह इस्तेमाल किया गया तो recursive training disaster के कारण सारे models विफल हो जाएँगे, इसलिए इसे शुरू से ही स्पष्ट था ऐसा कहकर नहीं पेश करना चाहिए
API distillation नए तरह के reinforcement learning में cold start जल्दी पार करने के लिए उपयोगी हो सकती है, लेकिन असल में ज़्यादा महत्वपूर्ण चीज़ उस reinforcement learning environment की quality और diversity है जिसमें model सीखता है
अमेरिका ने अभी तक rare earths पर चीन जैसी control policy नहीं अपनाई है, लेकिन अगर distillation फैलती है तो जो पक्ष ऐसा नहीं करेगा, उसके ऊपर भी access blocking या अत्यधिक control जैसे regulatory costs आने की संभावना बड़ी है। जैसे संगीत की copying पर नरमी रही लेकिन visual art पर लोग भड़क उठे, वैसे ही इसे चोरी माना जाए या सामान्य कारोबार, यह आखिरकार सामाजिक सहमति पर निर्भर करेगा; कोई बड़ा breakthrough न हुआ तो फ़ासला घटेगा
हम उम्मीद से कहीं ज़्यादा जल्दी इस बिंदु पर पहुँच गए। अगर पश्चिमी सरकारें open-weight frontier models तक पहुँच को राष्ट्रीय सुरक्षा जोखिम घोषित कर दें और उनके इस्तेमाल को आतंकवादी गतिविधि की श्रेणी में रख दें, तो दुनिया कैसी होगी, यह सोचने वाली बात है
Kimi K3 शायद Napster जैसा बन जाए जिसे सब लोग जानते हुए भी इस्तेमाल करते थे कि वह अवैध है, या फिर ऐसा underground बाज़ार उभरे जहाँ मोहल्ले में कोई व्यक्ति eBay के parts से basement में बनाई 8×5090 मशीन को usage-meter के हिसाब से किराए पर दे। उल्टा अगर नियंत्रण सफल हो गया, तो खुले विकल्प सिर्फ़ कमज़ोर किए गए Cohere·Mistral रह जाएँगे, और चीन से पीछे छूटते Anthropic·OpenAI के ‘American Frontier’ models के लिए महँगी क़ीमत चुकानी पड़ सकती है
विज्ञापन-सब्सिडी वाले Kindle Fire की तरह, ऐसा Kindle AI भी आ सकता है जो सबसे ऊँची बोली लगाने वाले को influence बेचता हो, तंबाकू कंपनियों का प्रचार training pipeline में पहुँच जाए, और LLM यह कहने लगे कि धूम्रपान स्वास्थ्य के लिए अच्छा है
अमेरिकी सरकार ने हाल में NSF scientific collaboration पर Wolf Amendment जैसी पाबंदियाँ घोषित की हैं और अधिकार-क्षेत्र को military पक्ष की ओर खिसकाया है, साथ ही चीन को बाहर रखने वाली Pax Silica में कई देशों को शामिल करने और सहयोगी देशों पर सीमित-क्षमता वाले अपने products थोपने की कोशिश कर रही है। हो सकता है Switzerland या Singapore जैसे कुछ neutral क्षेत्र बचे रहें जहाँ अमेरिका·EU users बिना कानूनी नुकसान के इस परदे के उस पार की services इस्तेमाल कर सकें
https://nitter.net/RnaudBertrand/status/2069574934972797089
मैंने आम तौर पर हर मॉडल से टेस्ट करवाने वाले इस काम को Kimi K3 को दिया, तो उसने काफ़ी ज़्यादा देर तक सोचा और 19 डॉलर प्लान के 5 घंटे के usage का लगभग पूरा हिस्सा ख़त्म कर दिया। यही काम OpenAI के 20 डॉलर प्लान पर करने में सिर्फ़ कुछ मिनट लगे और usage भी लगभग कम नहीं हुआ
subscription limit token जैसी तुलना योग्य संख्या नहीं देती, इसलिए इसे मापना मुश्किल है, लेकिन 20 डॉलर के आसपास का ऐसा subscription पहली बार देखा जिसमें एक मामूली काम से ही असली काम के लिए रखा usage लगभग गायब हो गया। स्पीड धीमी थी और प्रति काम लागत भी ज़्यादा लगी, लेकिन Gemini 3.5 Flash ने जो bug मनमाने ढंग से बना दिया था, उसे इसने पकड़ लिया
GLM 5.2 से लगभग 50 लाइन JavaScript को Python में port करवाने पर भी उसने web search और review बार-बार दोहराए, जिससे API cost 0.25 डॉलर लगी; पहली run असफल रही, लेकिन दूसरी बार काम किया। Claude Code/Fable काफ़ी तेज़ थे, लेकिन उन्होंने भी वही error दिया; उम्मीद है कि open model का अत्यधिक self-review कम होगा या prompt करने का तरीका सुधरेगा
चीनी मॉडल अभी इस मानक तक नहीं पहुँचते दिखते, और लगता है कि वे efficiency से ज़्यादा benchmark score को अधिकतम करने पर केंद्रित हैं
maxपर सपोर्ट करता है, लेकिन दूसरे स्तर भी जल्द आने वाले हैं। benchmark trace रिकॉर्ड में “रुको, लेकिन…” जैसी बार-बार पीछे लौटने और अनिश्चितता बहुत दिखी, और GPT 5.6 तथा Fable केxhigh·maxमें भी कम स्तर पर सही, कुछ ऐसा ही थाअगर कम reasoning intensity सपोर्ट हुई, तो token inefficiency में सुधार हो सकता है
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-reviewचलाया, लेकिन code बदले बिना ही usage 99% तक पहुँच गया, और बचे 1% सेreview.mdभी नहीं लिख पायाआम तौर पर review में 10~20% लगता है, लेकिन कभी-कभी सिर्फ़ 15 मिनट में 65~69% गायब हो जाता है, यानी usage volatility बहुत ज़्यादा है
Kimi paid plan में 10 लाख token context length सिर्फ़ 79 डॉलर प्रति माह या उससे ऊपर पर मिलती है; उसके नीचे यह 2 लाख 56 हज़ार token तक सीमित है। वार्षिक भुगतान छूट के हिसाब से 15 डॉलर प्रति माह वाले सबसे सस्ते प्लान में अभी K3 खुद सपोर्ट नहीं है
https://www.kimi.com/code/docs/en/kimi-code/models.html
मुझे तो उल्टा लगता है। Kimi K3 में 2.8 ट्रिलियन parameters हैं, और ChatGPT 5.6 या Opus 4.8 का आकार सार्वजनिक नहीं है, लेकिन समान होने की संभावना है; Fable·Mythos के बारे में लगभग 10 ट्रिलियन की अफ़वाह है
प्रति दस लाख token input/output price में K3 3 डॉलर·15 डॉलर, ChatGPT 5.6 Sol 5 डॉलर·30 डॉलर, और Opus 4.8 5 डॉलर·25 डॉलर है, इसलिए फ़र्क बहुत बड़ा नहीं है। यह किसी ऐतिहासिक मोड़ से ज़्यादा ऐसा लगता है कि प्रतिस्पर्धी लगभग उसी performance पर converge होकर थोड़ा सस्ता बेच रहे हैं। अभी K3 के weights भी private हैं, इसलिए हालात बदलते नहीं दिखते
इस thread में भी Kimi की वास्तविक उपयोगिता पर राय बंटी हुई है। निजी तौर पर मुझे यह Fable और 5.6 Sol से कमज़ोर लगता है, लेकिन चर्चा का केंद्र performance से ज़्यादा अमेरिकी सरकार की regulatory कार्रवाई के ख़िलाफ़ प्रतिक्रिया जैसा दिखता है
मौजूदा हालात पर ग़ुस्सा और हताशा की वजह से Kimi के बेहतर होने की इच्छा-प्रेरित मनोवृत्ति भी काम कर रही लगती है
यह काम के प्रकार और इस्तेमाल के तरीके पर बहुत निर्भर करता है, लेकिन K3 अमेरिकी cutting-edge मॉडल के बराबर नहीं है—यह आकलन मेरे उपयोग अनुभव से मेल नहीं खाता
यहाँ यह साफ़ करना ज़रूरी है कि ‘Claude’ से मतलब Opus है या Fable, और reasoning intensity किस स्तर की है
मूल अभिव्यक्ति सटीक नहीं थी, और मैं ज़्यादातर समय Fable या K3 का उपयोग नहीं करता; आम तौर पर छोटे दायरे के काम करवाकर बाद में ख़ुद review करता हूँ
गोपनीयता नीति भी कोई छोटी समस्या नहीं है। Kimi subscription इस्तेमाल करने पर interactions को model training में इस्तेमाल किया जाता है, और उन्होंने कहा है कि केवल API pricing के तहत सीधे API इस्तेमाल करने पर ही ऐसा नहीं किया जाता। इस पर भरोसा करना अलग बात है
मेरा विचार है कि OpenRouter पर दूसरे provider आने तक इंतज़ार करूँ और फिर उनकी विश्वसनीयता का आकलन करूँ। भले ही उन पर बहुत भरोसा न हो, अगर provider खुद model train नहीं करता, तो डेटा के training में इस्तेमाल होने की संभावना कम होगी
99% users ऐसा कोई विशेष बौद्धिक संपदा नहीं संभालते जिसकी सच में चिंता करनी पड़े
अब तक अंत में सब कुछ distillation ही था। जैसा Suhail ने कहा, AI models के मुनाफ़े को लगभग शून्य कर देना चाहिए
चूँकि इन्हें मानवता के data पर train किया गया है, इसलिए यह मानवता को दिया गया उपहार होना चाहिए, और तभी कुछ लोग मानवता को नियंत्रित करने से रोके जा सकेंगे
Open source models पहले ही शीर्ष commercial models के स्तर तक पहुँच चुके हैं। आख़िरी bottleneck hardware है, लेकिन वह बाधा भी तेज़ी से कम हो रही है
Kimi K3 को घर पर चलाना अभी भी बहुत महँगा है, लेकिन मध्यम hardware पर चल सकने वाले सक्षम free models पहले से ही बहुत हैं, और यह रुझान आगे भी जारी रहेगा