2 पॉइंट द्वारा GN⁺ 1 일 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • रोज़मर्रा के coding कामों में Kimi K3 और Claude को साथ इस्तेमाल करने पर, output quality और जवाब के लिए ज़रूरी token की संख्या में व्यावहारिक फर्क पहचानना मुश्किल था
  • Kimi K3 API की कीमत input के लिए प्रति 10 लाख token $3 और output के लिए $15 है, जो क्रमशः $10 और $50 वाले Claude के top-tier model से काफ़ी सस्ती है
  • Kimi की शुरुआत $19 प्रति माह से होती है और $39 प्रति माह coding tier भी काफ़ी उदार है, जबकि Claude में agent work के दौरान usage limit जल्दी खत्म हो जाती है और $20 प्रति माह प्लान पर Fable access भी बना नहीं रह सका
  • Semgrep के cyber security benchmark में, जहां सीमित Claude ने कुछ काम ठुकरा दिए, वहीं GLM 5.2 ने वे काम पूरे किए और आगे निकल गया; यह MIT license के तहत जारी है और नवीनतम Opus से सस्ता भी है
  • सिर्फ़ अमेरिकी models पर लागू पाबंदियां अमेरिकी ग्राहकों के विकल्प घटाती हैं, लेकिन विदेशी open models की प्रतिस्पर्धा नहीं रोक पातीं; इसलिए जब quality मिलती-जुलती हो और कीमत कम हो, तो Kimi K3 के रहते Claude का भुगतान जारी रखने की वजह कम हो जाती है

Kimi K3 और Claude की quality·price तुलना

  • Kimi K3 को सामान्य coding कामों में Claude के साथ इस्तेमाल करने पर एक जैसे काम और output quality, और लगभग समान token usage देखा गया
    • यह उस उम्मीद से अलग था कि open models के नतीजे ज़्यादा बेतरतीब होंगे या वही जवाब पाने के लिए ज़्यादा token खर्च होंगे
  • API कीमत में Kimi K3 input के लिए प्रति 10 लाख token $3 और output के लिए प्रति 10 लाख token $15 लेता है
    • Claude का top-tier model इसी इकाई पर क्रमशः $10 और $50 है
  • Kimi का paid plan $19 प्रति माह से शुरू होता है, और $39 प्रति माह वाला coding tier समान कीमत वाले Claude products की तुलना में ज़्यादा usage देता है
    • Claude plans में usage limit काफ़ी सख्त है, इसलिए सामान्य agent work में भी दोपहर के खाने से पहले quota खत्म हो सकता है
    • Claude $20 प्रति माह प्लान पर Fable access बनाए नहीं रख सका, इसलिए उसे बंद कर Opus पर स्विच किया गया, जबकि Kimi tier में ऐसी शर्त नहीं है

अमेरिकी AI नीति और open model प्रतिस्पर्धा

  • अमेरिकी सरकार ने Fable की release में देरी कराई, और अंतिम model पर भी कई तरह के tasks को अस्वीकार करने वाली सीमाएं लागू रहीं; इसके विपरीत, चीन की labs के frontier-grade open models डाउनलोड किए जा सकते हैं, इसलिए वे अमेरिकी सरकारी regulation की पहुंच से बाहर हैं
  • Semgrep के cyber security benchmark में GLM 5.2, Claude से आगे रहा
    • सीमित model ने tasks ठुकराए, लेकिन open model ने उन्हें पूरा किया, और इसी फर्क ने नतीजों को प्रभावित किया
  • GLM 5.2 MIT license के तहत जारी किया गया है, और खुद को frontier model कहकर पेश न करने के बावजूद, वास्तविक कामों में यह नवीनतम Opus से बेहतर नतीजे देता है और इसकी लागत भी काफ़ी कम है
  • OpenAI का GPT-5.6 भी सरकारी प्रतिबंध प्रक्रिया से गुज़रा, लेकिन OpenAI अपने मुख्य model को $20 प्रति माह प्लान में दे सकता है, इसलिए उसके पास Anthropic की तुलना में ज़्यादा गुंजाइश है
  • आगे चलकर अमेरिकी सरकार automobile industry में इस्तेमाल किए गए subsidy, bailout, protective tariff जैसे तरीकों को AI और open source पर लागू कर सकती है
    • public-private partnership के ज़रिए वह ऐसे घरेलू models को support कर सकती है जो सिर्फ़ अमेरिका के भीतर इस्तेमाल हों और अंतरराष्ट्रीय स्तर पर प्रतिस्पर्धी न हों
    • नतीजतन, अमेरिकी users को best quality या lowest price के बजाय घरेलू models खरीदने पड़ सकते हैं, और वे सबसे अच्छे models सबसे अच्छी कीमत पर इस्तेमाल नहीं कर पाएंगे

1 टिप्पणियां

 
GN⁺ 1 일 전
Hacker News की राय
  • चाहे distillation के ज़रिए इसी स्तर का प्रदर्शन हासिल किया गया हो या शुरुआत से स्वतंत्र रूप से विकसित किया गया हो, अमेरिकी frontier labs का नतीजा शुरू से ही लगभग तय था। Distillation कोई हमला नहीं है, और frontier labs ने भी इंसानों द्वारा लिखे ज्ञान को models में distill किया है, इसलिए बाद में आने वाली labs का उसे और सस्ते models में compress करना एक स्वाभाविक क्रम है
    बातचीत को सेव करके उसे अपने model training में इस्तेमाल होने से वास्तव में रोकने का कोई व्यावहारिक तरीका भी नहीं है, इसलिए model कंपनियों की बजाय hardware कंपनियों में निवेश करना बेहतर लगता है

    • यह कहना कि यह इतना स्वाभाविक था, काफ़ी हद तक बाद की इतिहास-व्याख्या जैसा है। Distillation अब भी एक सक्रिय research क्षेत्र है, और आज की तरह models को इतनी आसानी से distill किया जा सकता है, यह एक दिलचस्प उपलब्धि है; 12 महीने पहले से इसे तय नतीजा नहीं माना जाता था
      सिर्फ़ 6 महीने पहले तक भी बहुत से लोग मानते थे कि अगर model outputs को training data की तरह इस्तेमाल किया गया तो recursive training disaster के कारण सारे models विफल हो जाएँगे, इसलिए इसे शुरू से ही स्पष्ट था ऐसा कहकर नहीं पेश करना चाहिए
    • मैं इस बात से मज़बूती से सहमत हूँ कि distillation हमला नहीं है, लेकिन K3, Fable या Sol का distilled version नहीं है। Fable को सार्वजनिक हुए ज़्यादा समय नहीं हुआ है और Sol अभी-अभी लॉन्च हुआ है, जबकि Arena user ratings में K3 कुछ क्षेत्रों में दोनों से बेहतर है
      API distillation नए तरह के reinforcement learning में cold start जल्दी पार करने के लिए उपयोगी हो सकती है, लेकिन असल में ज़्यादा महत्वपूर्ण चीज़ उस reinforcement learning environment की quality और diversity है जिसमें model सीखता है
    • लगता है distillation attack के प्रभाव को कुछ ज़्यादा बढ़ा-चढ़ाकर बताया गया है। अब अधिकांश fine-tuning data synthetic data है, और वही बात बस दोहराई नहीं जा सकती, इसलिए यह ज़्यादा उस तरह है जैसे कोई दूसरा LLM बिना कुछ छोड़े किसी विषय को विस्तार से समझाने वाली पाठ्यसामग्री लिख रहा हो
    • लगभग हर बाज़ार किसी न किसी तरह के regulation पर निर्भर करता है—‘सिर्फ़ चोरी पर रोक, बाकी सब आज़ाद’ से लेकर हर procurement पर भारी regulation तक
      अमेरिका ने अभी तक rare earths पर चीन जैसी control policy नहीं अपनाई है, लेकिन अगर distillation फैलती है तो जो पक्ष ऐसा नहीं करेगा, उसके ऊपर भी access blocking या अत्यधिक control जैसे regulatory costs आने की संभावना बड़ी है। जैसे संगीत की copying पर नरमी रही लेकिन visual art पर लोग भड़क उठे, वैसे ही इसे चोरी माना जाए या सामान्य कारोबार, यह आखिरकार सामाजिक सहमति पर निर्भर करेगा; कोई बड़ा breakthrough न हुआ तो फ़ासला घटेगा
    • Anthropic पुराने conversations में scroll करना या reasoning tokens और sub-agents तक देखना भी मुश्किल बना देता है। मानो सभी को लगातार अपनी ही service पर वापस लाना है, और उन्हें अपना कुआँ खुद खोदना सीखने ही नहीं देना है
  • हम उम्मीद से कहीं ज़्यादा जल्दी इस बिंदु पर पहुँच गए। अगर पश्चिमी सरकारें open-weight frontier models तक पहुँच को राष्ट्रीय सुरक्षा जोखिम घोषित कर दें और उनके इस्तेमाल को आतंकवादी गतिविधि की श्रेणी में रख दें, तो दुनिया कैसी होगी, यह सोचने वाली बात है
    Kimi K3 शायद Napster जैसा बन जाए जिसे सब लोग जानते हुए भी इस्तेमाल करते थे कि वह अवैध है, या फिर ऐसा underground बाज़ार उभरे जहाँ मोहल्ले में कोई व्यक्ति eBay के parts से basement में बनाई 8×5090 मशीन को usage-meter के हिसाब से किराए पर दे। उल्टा अगर नियंत्रण सफल हो गया, तो खुले विकल्प सिर्फ़ कमज़ोर किए गए Cohere·Mistral रह जाएँगे, और चीन से पीछे छूटते Anthropic·OpenAI के ‘American Frontier’ models के लिए महँगी क़ीमत चुकानी पड़ सकती है
    विज्ञापन-सब्सिडी वाले Kindle Fire की तरह, ऐसा Kindle AI भी आ सकता है जो सबसे ऊँची बोली लगाने वाले को influence बेचता हो, तंबाकू कंपनियों का प्रचार training pipeline में पहुँच जाए, और LLM यह कहने लगे कि धूम्रपान स्वास्थ्य के लिए अच्छा है

    • इसका मतलब होगा कि दुनिया डिजिटल blocs में बँटती हुई एक नया iron curtain देखेगी। आदान-प्रदान का टूटना जितना लंबा चलेगा, open internet और science के परस्पर असंगत ecosystems में बँटने की संभावना उतनी बढ़ेगी
      अमेरिकी सरकार ने हाल में NSF scientific collaboration पर Wolf Amendment जैसी पाबंदियाँ घोषित की हैं और अधिकार-क्षेत्र को military पक्ष की ओर खिसकाया है, साथ ही चीन को बाहर रखने वाली Pax Silica में कई देशों को शामिल करने और सहयोगी देशों पर सीमित-क्षमता वाले अपने products थोपने की कोशिश कर रही है। हो सकता है Switzerland या Singapore जैसे कुछ neutral क्षेत्र बचे रहें जहाँ अमेरिका·EU users बिना कानूनी नुकसान के इस परदे के उस पार की services इस्तेमाल कर सकें
      https://nitter.net/RnaudBertrand/status/2069574934972797089
    • high-RAM Mac Studio machines का गायब होना शायद संयोग ही होगा
    • अगर open source models को अवैध बना दिया गया, तो नुकसान सिर्फ़ अमेरिकी कंपनियों को होगा। दुनिया के बाकी हिस्से open source का इस्तेमाल जारी रखेंगे और अमेरिकी कंपनियों के खिलाफ arbitrage opportunity हासिल करेंगे
    • जानना चाहूँगा कि ‘पश्चिमी सरकारें’ से विशेष रूप से अमेरिका ही मतलब है या नहीं। अमेरिका जितनी चीन-चिंता न रखने वाले दूसरे देशों के पास इस मुद्दे पर बिल्कुल वही चिंता करने की वजह स्पष्ट नहीं है
    • 8×RTX Pro 6000 में भी सिर्फ़ 768GB VRAM है, इसलिए समझ नहीं आता कि K3 को कैसे चलाया जाएगा
  • मैंने आम तौर पर हर मॉडल से टेस्ट करवाने वाले इस काम को Kimi K3 को दिया, तो उसने काफ़ी ज़्यादा देर तक सोचा और 19 डॉलर प्लान के 5 घंटे के usage का लगभग पूरा हिस्सा ख़त्म कर दिया। यही काम OpenAI के 20 डॉलर प्लान पर करने में सिर्फ़ कुछ मिनट लगे और usage भी लगभग कम नहीं हुआ
    subscription limit token जैसी तुलना योग्य संख्या नहीं देती, इसलिए इसे मापना मुश्किल है, लेकिन 20 डॉलर के आसपास का ऐसा subscription पहली बार देखा जिसमें एक मामूली काम से ही असली काम के लिए रखा usage लगभग गायब हो गया। स्पीड धीमी थी और प्रति काम लागत भी ज़्यादा लगी, लेकिन Gemini 3.5 Flash ने जो bug मनमाने ढंग से बना दिया था, उसे इसने पकड़ लिया

    • Kimi में लगातार ख़ुद पर शक करते हुए ज़रूरत से ज़्यादा देर तक सोचते रहने की प्रवृत्ति है। किसी छोटे detail पर “रुको, असल में…” जैसे पैराग्राफ़ दोहराते हुए यह बहुत सारे token खर्च करता है
      GLM 5.2 से लगभग 50 लाइन JavaScript को Python में port करवाने पर भी उसने web search और review बार-बार दोहराए, जिससे API cost 0.25 डॉलर लगी; पहली run असफल रही, लेकिन दूसरी बार काम किया। Claude Code/Fable काफ़ी तेज़ थे, लेकिन उन्होंने भी वही error दिया; उम्मीद है कि open model का अत्यधिक self-review कम होगा या prompt करने का तरीका सुधरेगा
    • प्रति दस लाख token की कीमत को मानक बनाना बंद करने की ज़रूरत है। दिखाई गई token unit price से ज़्यादा असर असल में इस्तेमाल हुए token की संख्या का पड़ता है, इसलिए असली मायने intelligence के मुकाबले प्रति काम लागत curve के हैं
      चीनी मॉडल अभी इस मानक तक नहीं पहुँचते दिखते, और लगता है कि वे efficiency से ज़्यादा benchmark score को अधिकतम करने पर केंद्रित हैं
    • Kimi K3 अभी reasoning intensity सिर्फ़ max पर सपोर्ट करता है, लेकिन दूसरे स्तर भी जल्द आने वाले हैं। benchmark trace रिकॉर्ड में “रुको, लेकिन…” जैसी बार-बार पीछे लौटने और अनिश्चितता बहुत दिखी, और GPT 5.6 तथा Fable के xhigh·max में भी कम स्तर पर सही, कुछ ऐसा ही था
      अगर कम reasoning intensity सपोर्ट हुई, तो token inefficiency में सुधार हो सकता है
      https://platform.kimi.ai/docs/guide/use-thinking-effort
    • Claude Code/Fable को feature implementation दिया, तो लगभग 60 मिनट में 100 यूरो subscription की 5 घंटे की session का 30% इस्तेमाल हो गया। उसके बाद अलग terminal की clean session में सिर्फ़ /code-review चलाया, लेकिन code बदले बिना ही usage 99% तक पहुँच गया, और बचे 1% से review.md भी नहीं लिख पाया
      आम तौर पर review में 10~20% लगता है, लेकिन कभी-कभी सिर्फ़ 15 मिनट में 65~69% गायब हो जाता है, यानी usage volatility बहुत ज़्यादा है
    • AI subscription pricing अजीब है। हर मॉडल का usage अलग है, इसे provider interface या model द्वारा मनमाने ढंग से खपत किए गए अपारदर्शी token से मापा जाता है, और ऊपर से अस्पष्ट time-window limit भी लागू होती है
  • Kimi paid plan में 10 लाख token context length सिर्फ़ 79 डॉलर प्रति माह या उससे ऊपर पर मिलती है; उसके नीचे यह 2 लाख 56 हज़ार token तक सीमित है। वार्षिक भुगतान छूट के हिसाब से 15 डॉलर प्रति माह वाले सबसे सस्ते प्लान में अभी K3 खुद सपोर्ट नहीं है
    https://www.kimi.com/code/docs/en/kimi-code/models.html

    • मैं सिर्फ़ API इस्तेमाल करना चाहता हूँ, लेकिन DeepSeek में Reasonix/whale tools और high cache hit rate का संयोजन लागत को लगभग मुफ़्त के करीब ले आता है, इसलिए किसी दूसरी service पर जाना आसान नहीं लगेगा
  • मुझे तो उल्टा लगता है। Kimi K3 में 2.8 ट्रिलियन parameters हैं, और ChatGPT 5.6 या Opus 4.8 का आकार सार्वजनिक नहीं है, लेकिन समान होने की संभावना है; Fable·Mythos के बारे में लगभग 10 ट्रिलियन की अफ़वाह है
    प्रति दस लाख token input/output price में K3 3 डॉलर·15 डॉलर, ChatGPT 5.6 Sol 5 डॉलर·30 डॉलर, और Opus 4.8 5 डॉलर·25 डॉलर है, इसलिए फ़र्क बहुत बड़ा नहीं है। यह किसी ऐतिहासिक मोड़ से ज़्यादा ऐसा लगता है कि प्रतिस्पर्धी लगभग उसी performance पर converge होकर थोड़ा सस्ता बेच रहे हैं। अभी K3 के weights भी private हैं, इसलिए हालात बदलते नहीं दिखते

    • आधिकारिक घोषणा के मुताबिक पूरा model weight 27 जुलाई 2026 तक सार्वजनिक किया जाएगा
    • यह भी देखें कि OpenAI ने 5 घंटे की limit हटा दी है और साप्ताहिक limit को भी अक्सर reset किया है; ऐसे में यह सवाल बना रहता है कि effective price में Kimi सचमुच सस्ता है भी या नहीं
  • इस thread में भी Kimi की वास्तविक उपयोगिता पर राय बंटी हुई है। निजी तौर पर मुझे यह Fable और 5.6 Sol से कमज़ोर लगता है, लेकिन चर्चा का केंद्र performance से ज़्यादा अमेरिकी सरकार की regulatory कार्रवाई के ख़िलाफ़ प्रतिक्रिया जैसा दिखता है
    मौजूदा हालात पर ग़ुस्सा और हताशा की वजह से Kimi के बेहतर होने की इच्छा-प्रेरित मनोवृत्ति भी काम कर रही लगती है

    • K3 काफ़ी अच्छा है और इसे Sol और Fable के बीच रखा जा सकता है। Sol की UI design क्षमता प्रभावशाली नहीं है, लेकिन K3 इस क्षेत्र में मज़बूत है, और Fable कुल मिलाकर सबसे तेज़ और सबसे consistent performance देता है
      यह काम के प्रकार और इस्तेमाल के तरीके पर बहुत निर्भर करता है, लेकिन K3 अमेरिकी cutting-edge मॉडल के बराबर नहीं है—यह आकलन मेरे उपयोग अनुभव से मेल नहीं खाता
    • यह DeepSeek के समय की पुनरावृत्ति जैसा लगता है। जब v3 आया था तब भी कहा गया था कि अमेरिकी कंपनियाँ ख़त्म हो गईं, लेकिन आख़िर में सब कुछ वैसा ही चलता रहा
    • मैंने अनगिनत बार सुना है कि frontier model, open weight model से 6 महीने से ज़्यादा आगे हैं, लेकिन अब यह सच नहीं है। इसलिए मूल्यांकन का मानदंड बदल रहा है
    • अमेरिकी सरकार ने इस साल AI के संबंध में जो किया है, उसे स्वीकार करना मुश्किल है, इसलिए ऐसी प्रतिक्रिया आना समझ में आता है
  • यहाँ यह साफ़ करना ज़रूरी है कि ‘Claude’ से मतलब Opus है या Fable, और reasoning intensity किस स्तर की है

    • ‘रोज़मर्रा के coding काम’ में फ़र्क समझ नहीं आता, यह सुनकर ऐसा लगता है कि काम ऐसे दिए गए थे जिन्हें परिणामों में अंतर पहचानने लायक गहराई से समझा ही नहीं गया था
    • तुलना Fable High और K3 High के बीच थी, और मुख्य उपयोग game development था। धुंधले visual bug ठीक करना, scene या model का रूप बदलना, बड़े feature जोड़ना जैसी चीज़ें करवाई गईं
      मूल अभिव्यक्ति सटीक नहीं थी, और मैं ज़्यादातर समय Fable या K3 का उपयोग नहीं करता; आम तौर पर छोटे दायरे के काम करवाकर बाद में ख़ुद review करता हूँ
  • गोपनीयता नीति भी कोई छोटी समस्या नहीं है। Kimi subscription इस्तेमाल करने पर interactions को model training में इस्तेमाल किया जाता है, और उन्होंने कहा है कि केवल API pricing के तहत सीधे API इस्तेमाल करने पर ही ऐसा नहीं किया जाता। इस पर भरोसा करना अलग बात है
    मेरा विचार है कि OpenRouter पर दूसरे provider आने तक इंतज़ार करूँ और फिर उनकी विश्वसनीयता का आकलन करूँ। भले ही उन पर बहुत भरोसा न हो, अगर provider खुद model train नहीं करता, तो डेटा के training में इस्तेमाल होने की संभावना कम होगी

    • ऐसी चिंताएँ अब धीरे-धीरे हास्यास्पद लगने लगी हैं। ज़्यादातर input तो उसी model के पहले बनाए गए output और किसी व्यक्ति के जल्दबाज़ी में लिखे गए निर्देश जैसे “गलती के बिना ठीक करो” ही होते हैं, इसलिए अगर भविष्य के model बेहतर बनते हैं, तो training में इस्तेमाल होना भी ठीक है
      99% users ऐसा कोई विशेष बौद्धिक संपदा नहीं संभालते जिसकी सच में चिंता करनी पड़े
    • भले ही सभी hobby users open weights model इस्तेमाल करें, enterprise no-data-retention market फिर भी अमेरिकी कंपनियों के लिए पर्याप्त व्यावसायिक अवसर देगा
    • यह policy इस्तेमाल न करने की वजह है। मेरा इरादा है कि independent provider services आने तक इंतज़ार करूँ, जो open weights की वजह से संभव हैं
  • अब तक अंत में सब कुछ distillation ही था। जैसा Suhail ने कहा, AI models के मुनाफ़े को लगभग शून्य कर देना चाहिए
    चूँकि इन्हें मानवता के data पर train किया गया है, इसलिए यह मानवता को दिया गया उपहार होना चाहिए, और तभी कुछ लोग मानवता को नियंत्रित करने से रोके जा सकेंगे

    • चीन के बड़े models को अब भी सिर्फ़ ‘distilled versions’ के रूप में देखना हास्यास्पद है। बहुत से लोग अभी तक उस लहर को नहीं पहचान रहे जो अमेरिकी frontier labs पर टूट पड़ेगी—वे labs जो विशाल data का इस्तेमाल करके censored और सीमित performance वाले models में users को बाँधकर रखना चाहती थीं
  • Open source models पहले ही शीर्ष commercial models के स्तर तक पहुँच चुके हैं। आख़िरी bottleneck hardware है, लेकिन वह बाधा भी तेज़ी से कम हो रही है
    Kimi K3 को घर पर चलाना अभी भी बहुत महँगा है, लेकिन मध्यम hardware पर चल सकने वाले सक्षम free models पहले से ही बहुत हैं, और यह रुझान आगे भी जारी रहेगा