5 पॉइंट द्वारा GN⁺ 1 일 전 | 4 टिप्पणियां | WhatsApp पर शेयर करें
  • Alibaba Qwen ने 2.4 ट्रिलियन पैरामीटर वाले Qwen3.8 को जारी किया है और जल्द ही इसके open weights भी सार्वजनिक करने की योजना है
  • Qwen3.8 को लगातार विकसित हो रहे मॉडल के रूप में पेश किया गया है, और कहा गया है कि यह अग्रणी frontier AI models के अनुरूप है
  • Qwen के अनुसार, Qwen3.8 फिलहाल सबसे शक्तिशाली मॉडलों में से एक है और Fable 5 के अगले स्तर का है
  • Qwen3.8-Max-Preview को Alibaba Token Plan, Qoder, और QoderWork में अभी तुरंत आज़माया जा सकता है
  • Token Plan, अंतरराष्ट्रीय उपयोगकर्ताओं और चीन के उपयोगकर्ताओं के लिए अलग pricing pages चलाता है
    • अंतरराष्ट्रीय उपयोगकर्ताओं के लिए Lite/Standard/Pro के 3 स्तर हैं, जिनकी promotional pricing क्रमशः प्रति माह $6/$18/$68 है
    • हर प्लान में 7 दिनों के लिए 2,500/10,000/40,000 Credits और 5 घंटों के लिए 700/3,000/12,000 Credits दिए जाते हैं
    • एक साथ चलाए जा सकने वाले agents की संख्या क्रमशः 1~2/3~4/6~8 है, और OpenAI/Anthropic protocol को सपोर्ट करने वाले tools में API Key और Base URL के जरिए कनेक्ट किया जा सकता है

4 टिप्पणियां

 
fanotify 1 일 전

एक इन्फोग्राफिक मिला, इसलिए शेयर कर रहा/रही हूँ: https://i.postimg.cc/63yLvz16/modelsize202607.png
(kimi वाले को थोड़ा अपडेट करके इसमें इस बार की qwen 3.8 जानकारी जोड़ दी है)

 
cadenzah 1 시간 전

उस लिंक को सार्वजनिक जगह पर न खोलें!

 
thkweon 1 일 전

साइट पर विज्ञापन बहुत ज़्यादा हैं।

 
GN⁺ 1 일 전
Hacker News की राय
  • यह घोषणा शायद Moonshot AI की उस घोषणा के जवाब में लगती है जिसमें उसने कहा था कि वह 2.8 ट्रिलियन पैरामीटर वाला open-weight LLM Kimi K3 को 27 जुलाई तक Hugging Face पर जारी करेगा
    Alibaba ने भी जवाब में कहा कि वह जल्द ही 2.4 ट्रिलियन पैरामीटर वाला Qwen 3.8 open-weight के रूप में जारी करेगा, लेकिन यह जानना दिलचस्प है कि क्या यह उसकी मूल योजना थी या Moonshot AI से प्रतिस्पर्धा करने के लिए लिया गया फैसला
    किसी भी हालत में, ऐसी LLM प्रतिस्पर्धा का विजेता उपयोगकर्ता होता है

    • मंशा के बारे में पक्का कहना मुश्किल है, लेकिन चीनी कंपनियाँ शायद intelligence को सार्वजनिक उपयोगिता जैसी चीज़ बनाने पर काम कर रही हैं
      यह अमेरिकी frontier labs की वैल्यू घटाने का सबसे असरदार तरीका हो सकता है, और मानवता के लिए भी बहुत फायदेमंद है
    • चीनी social media पर अक्सर एक मज़ाक चलता है: “दूसरे देशों की सरकारें anti-competitive व्यवहार को रोकने के लिए दखल देती हैं, लेकिन चीनी सरकार प्रतिस्पर्धा को दबाने के लिए दखल देती है”
      https://www.reuters.com/business/autos-transportation/what-i...
    • अभी घोषणा करने की वजह शायद World AI Conference का चल रहा होना है
      रोबोट boxing कर रहे हैं, चीन की प्रमुख AI कंपनियाँ अपने नए मॉडल पेश कर रही हैं, और Xi Jinping ने WAICO की स्थापना की घोषणा भी की है
      https://en.wikipedia.org/wiki/World_Artificial_Intelligence_...
    • यह घोषणा शायद उस समय के हिसाब से भी की गई हो जब Xi Jinping ने World AI Conference में एक राजनीतिक गठबंधन शुरू करते हुए कहा कि “AI development किसी एक देश की एकल दौड़ नहीं, बल्कि अंतरराष्ट्रीय सहयोग की एक symphony होनी चाहिए”
      बड़े conferences में आम तौर पर नए products और घोषणाओं की बाढ़ आ जाती है
      https://www.cnbc.com/2026/07/17/x-china-ai-summit-risks-secu...
    • काश वे विशाल मॉडल के बजाय Qwen 3.7-27B·122B या उसके बराबर का 3.8 वर्ज़न जारी करते
      Qwen और QwQ की ताकत हमेशा से घर पर चल सकने वाली बेहतरीन local inference रही है
  • Alibaba Cloud ने मेरा email address ब्लॉक कर दिया है, इसलिए मैं शुल्क नहीं चुका सकता और इस बार Pelican test नहीं कर पा रहा हूँ
    open-weight रिलीज़ या OpenRouter पर रजिस्ट्रेशन का इंतज़ार कर रहा हूँ

    • Pelican benchmark अब लगभग अकेली ऐसी evaluation प्रक्रिया है जिस पर मुझे भरोसा है
      यह भी अजीब है कि Alibaba जैसी कंपनी पैसे लेना मुश्किल बना रही है, जबकि वह शायद चाहेगी कि मशहूर developers उसके मॉडल को आज़माएँ
      OpenRouter पर आम तौर पर जल्दी लिस्टिंग हो जाती है, इसलिए उम्मीद है जल्द इस्तेमाल कर पाऊँगा। Qwen app डाउनलोड करके chat interface में local development के लिए MCP tools के साथ टेस्ट करने का तरीका भी है
  • उम्मीद है कि Qwen 3.8 के छोटे मॉडल भी जारी होंगे
    मैं 35B MoE और 27B dense model को लोकल पर इस्तेमाल करता हूँ, और ज़्यादातर कामों में Claude को कॉल करने की ज़रूरत नहीं पड़ती
    sensitive या private data वाले requests में यह खास तौर पर उपयोगी है

    • अच्छा होगा अगर 3.6 के 35B और 3.5 के 122B के बीच का कोई मिड-रेंज MoE मॉडल आए
      यह इतना शक्तिशाली हो सकता है कि घर के ऐसे कंप्यूटर पर भी speed और performance का बढ़िया संतुलन दे, जो बहुत महँगा न हो
    • यह प्रतिस्पर्धा अभी frontier AI वर्चस्व के ज़्यादा करीब लगती है, इसलिए चिंता है कि सक्षम छोटे मॉडल पीछे छूट सकते हैं
      बड़े labs अपने सोने के अंडे देने वाले हंस को end users के हवाले नहीं करना चाहते, और Nvidia जैसे hardware vendors भी सभी पक्षों से कमाई करने के लिए इस बाज़ार में उतर सकते हैं
    • समझ नहीं आता कि 2.4 ट्रिलियन पैरामीटर वाले मॉडल को 35B तक घटाकर accuracy कैसे बरकरार रखी जा सकती है
      ऐसा करने के लिए पूरी तरह अलग architecture चाहिए होगी
    • यह जानने की उत्सुकता है कि वे कौन-सा hardware इस्तेमाल कर रहे हैं
  • LMStudio में Qwen 3.6 27B चलाकर देखा; थोड़ा धीमा था, लेकिन उम्मीद से बेहतर निकला
    mtplx लगाने पर, बिना किसी बढ़ा-चढ़ाकर कहे, यह सचमुच 2–3 गुना तेज़ हो गया और काफ़ी प्रभावशाली लगा
    मैं जितना हो सके local models की तरफ जा रहा हूँ, और यह धीरे-धीरे व्यावहारिक विकल्प बनता जा रहा है। हालांकि मैं 6,000 डॉलर वाले अधिकतम स्पेक M5 Max MacBook का इस्तेमाल कर रहा हूँ, इसलिए यह hardware अभी भी ज़्यादातर लोगों की पहुँच से बाहर है
    आगे चलकर रुझान शायद ज़्यादा फोकस्ड तरीके से train किए गए छोटे मॉडलों को लोकल पर चलाने की तरफ जाएगा। cloud providers को अपना सारा data सौंपने का जोखिम बहुत बड़ा है, और जब उन पर मुनाफ़ा साबित करने का दबाव आएगा तो वे बेहिसाब कीमतें वसूलेंगे, ऐसा लगता है

    • हाल की price increase के बाद, वह notebook अब शायद 8,000 डॉलर के करीब पड़ती होगी
  • एक महीने तक रोज़ इस्तेमाल करने के बाद Qwen 3.7 Pro व्यावहारिक रूप से बेकार लगा
    यह बहुत ज़्यादा समय बर्बाद करता था, काम की दिशा खो देता था या बेकार की पुनरावृत्ति में फँस जाता था, और debugging भी ठीक से नहीं कर पाता था
    DeepSeek V4 Pro से फर्क बहुत साफ़ था, और अब तक Qwen software engineering के लिए सबसे खराब मॉडल जैसा लगा। DeepSeek से कहीं महंगा होने के बावजूद न तो इस पर काम delegate किया जा सकता था, न ही इसे real-time low-level काम में इस्तेमाल किया जा सकता था

    • मैंने Q8 में quantize किए गए Qwen3.6-35B और 27B को llama.cpp में local तौर पर चलाया, और antirez का DS4-flash quantized मॉडल भी इस्तेमाल किया
      सब लगभग एक जैसे स्तर के थे, DS4 थोड़ा ज़्यादा efficient था, लेकिन Bash scripts, debugging, Python, और कुछ C++ कामों में सबने बहुत अच्छे नतीजे दिए
      जानना चाहूँगा कि Qwen किस application या language में फेल हुआ। Qwen का chat template टूटा हुआ है, इसलिए मुझे खुद debugging करनी पड़ी, और इसे ठीक करने पर भी काम चल रहा है; Gemma में भी ऐसा ही था
    • मेरे हिसाब से Qwen 3.7 Max Opus से बेहतर है और काफी तेज़ भी, हालांकि Fable से थोड़ा पीछे है
      यह speed और overall understanding में DeepSeek 4 Pro से काफी आगे था, और मैं इसे ज़्यादातर Claude Code में साथ में इस्तेमाल करता हूँ
      Qwen 3.7 Plus भी sub-agents के लिए काफी ठीक है और Sonnet से बहुत बेहतर है। Qwen 3.8 Max Preview भी अभी अच्छा चल रहा है, लेकिन फैसला करना अभी जल्दबाज़ी होगी; अगर यह सामान्य कीमत का 10% है, तो value-for-money शानदार है
    • Qwen 3.7 Pro साधारण है, लेकिन 3.7 Max बहुत अच्छा मॉडल है
    • मैंने DeepSeek API में 2 डॉलर डाले और Void Editor में key जोड़कर HTML में एक crypto tool बनाया
      कई सौ लाइनों वाली CSV example file के साथ एक-दो घंटे हल्की coding और bug fixes किए, और करीब 1.8 डॉलर खर्च हुए
      अगर यह लागत सामान्य है, तो एक महीने काम में इस्तेमाल करने पर शायद मेरी तनख्वाह से भी ज़्यादा खर्च हो जाए; सोच रहा हूँ क्या cloud providers वाकई इतने महंगे हैं
    • Anthropic को knowledge distillation attacks में रुकावट नहीं डालनी चाहिए थी
  • DeepSeek 4 final version भी जल्द आने वाला है
    शायद यह Opus 4.8 स्तर का होगा, और DeepSeek की कीमत को देखते हुए यह काफी बड़ा घटनाक्रम हो सकता है

    • DeepSeek का price-to-performance बेमिसाल है
      हाल में मैं V4 Flash काफी इस्तेमाल कर रहा हूँ, और यह काफी अच्छा है
    • DeepSeek V4 ज़्यादातर मॉडलों से 10~30 गुना सस्ता है, और अधिकतर कामों के लिए पर्याप्त है
    • कल WAIC का आखिरी दिन है, इसलिए उसी समय रिलीज़ होने की संभावना सबसे ज़्यादा है
    • यही वह मॉडल है जिसका मुझे सबसे ज़्यादा इंतज़ार है
      पिछले कुछ हफ्तों में DeepSeek Pro का खुद इस्तेमाल करते हुए मुझे ऐसे जवाब बढ़ते हुए दिखे हैं जो साफ़ तौर पर कहीं बेहतर मॉडल से आए लगते हैं
      performance इतनी अच्छी है कि closed-model खेमे में पहले ही “dark routing” या “Fable को सीधे चुरा लिया” जैसी fear, uncertainty, and doubt फैलाई जा रही है
      बढ़ी हुई कीमत पर भी यह जबरदस्त value देता है। अगर आपके पास सारे मॉडल आज़माने का समय नहीं है और आप सिर्फ वही इस्तेमाल करना चाहते हैं जो अभी सबसे अच्छा दिख रहा है, तो शायद इसका इस्तेमाल न करना ही नुकसान होगा। अगर आपने इस साल की पहली छमाही में OpenAI की जगह DeepSeek पर 1,200 डॉलर खर्च किए होते, तो शायद समझ आता कि आप कितना ज़्यादा काम कर सकते थे, और पछतावा होता
  • Artificial Analysis देखने पर पता चला कि कम से कम 12 providers ऐसे थे जो दावा करते हैं कि उनका performance Opus 4.5 से बेहतर है, जिसे Anthropic ने दिसंबर में जारी किया था और जिसे हाल की तेजी की शुरुआत माना जाता है
    switching cost भी कम है, इसे देखते हुए competition पूरी तरह overheated हो चुका है। मेरी राय में Opus 4.5 स्तर ज़्यादातर applications और use cases के लिए काफी है

    • इसलिए OpenAI और Anthropic शायद सरकारी regulation और bans की ज़्यादा ज़ोरदार माँग करेंगे
      नहीं तो उनका पूरा revenue model टूट जाएगा
  • OpenCode में Qwen Cloud Token Plan के साथ चलाने के लिए नीचे की setting काम करती है
    सटीक limit पता नहीं थी, इसलिए इसे Qwen 3.7 Max की limit के बराबर रखा है

    "provider": {  
      "alibaba-token-plan": {  
        "models": {  
          "qwen3.8-max-preview": {  
            "limit": {  
              "context": 1048576,  
              "output": 65536  
            },  
            "modalities": {  
              "input": ["text"],  
              "output": ["text"]  
            },  
            "name": "Qwen3.8 Max Preview"  
          }  
        }  
      }  
    }  
    
    • API endpoint और token बिल्कुल सही चुनने होंगे
      सही endpoint call करते ही quota लगभग तुरंत घटने लगता है, इसलिए इसे जरूर verify करना चाहिए
      गलती होने पर आप ऐसा API token खर्च कर सकते हैं जो membership Credits में शामिल नहीं है, और 3 दिनों में 200 डॉलर निकल सकते हैं; यही बात तब भी लागू होती है जब आपने Alibaba Cloud sign-up bonus के रूप में मिले 200 डॉलर इस्तेमाल किए हों
  • “Fable 5 के बाद सबसे बेहतर” जैसी बात काफी मायने रखती है
    शुरुआत में काफी skepticism था कि Fable, Opus से लगभग कोई खास प्रगति नहीं है, लेकिन पसंद हो या न हो, Anthropic ने इस शर्त पर कि वह इसका उपयोग जारी रहने देगा, उस मॉडल के साथ वास्तविक moat बना लिया है
    अगर open models इसे पार कर जाएँ, तो वह सचमुच दिलचस्प होगा

    • इसे moat कहना मुश्किल है, लेकिन यह निश्चित रूप से बेहतर मॉडल है
      मेरे काम में रैंकिंग Fable > K3 > Sol है
      हालांकि Fable बाकी दो मॉडलों से इतना भारी नहीं है कि उसके बिना मैं गंभीर रूप से प्रभावित हो जाऊँ। तीनों बेहतरीन हैं, और नियमित रूप से requests reject करने वाला मॉडल सिर्फ Fable है
    • इनका “moat” इस बात में है कि Mythos फिलहाल अकेला ultra-large model है
      10 ट्रिलियन parameters वाला मॉडल train करके 1 ट्रिलियन मॉडल से 10% बेहतर performance पाना हमेशा संभव रहा है
      अगर Mythos पहले के Opus जितने size और price वाला Opus 5 होता, तो वह निर्णायक फर्क होता, लेकिन वास्तविकता में ऐसा नहीं है
    • बेहतर मॉडल होने पर भी पाबंदियाँ बहुत ज़्यादा हैं, इसलिए यह Opus जितना उपयोगी नहीं है
    • Fable में output quality अक्सर गिर जाती है
      मैं Sol को मुख्य रूप से इस्तेमाल करता हूँ, और Fable creative हो सकता है, लेकिन बिना लगातार token जलाए स्थिर तरीके से काम पूरा करने में कमजोर है
  • चीन में AI competition तेज़ हो रही है
    Anthropic और OpenAI अगला क्या जारी करेंगे, इसका इंतज़ार है