1 पॉइंट द्वारा GN⁺ 2 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • अधिकतम reasoning सेटिंग ने AAII में 50 अंक हासिल किए, जिससे यह Kimi K3 (max) और GLM-5.2 (max) के बाद तीसरे स्थान पर है
  • यह 284 अरब कुल parameters वाला एक MoE मॉडल है, जिसमें हर token पर सिर्फ 13 अरब parameters सक्रिय होते हैं, और यह text input/output तथा 10 लाख token context को support करता है
  • API कीमत 10 लाख token पर input $0.14, output $0.28, cache hit $0.003 है, और Intelligence Index के पूरे मूल्यांकन की लागत $72.02 थी
  • मूल्यांकन के दौरान इसने 21 करोड़ output tokens का उपयोग किया, जो समान श्रेणी के मॉडलों के 10 करोड़ median से काफी अधिक था, और output speed अभी सार्वजनिक नहीं है
  • मॉडल weights सार्वजनिक हैं और MIT लाइसेंस लागू है, इसलिए self-hosting और commercial use संभव है, और फिलहाल API provider 1 ही है

मॉडल संरचना और सार्वजनिक रिलीज़ का तरीका

  • DeepSeek V4 Flash 0731 31 जुलाई 2026 को जारी किया गया एक reasoning open-weight मॉडल है
  • इसमें कुल 284 अरब parameters हैं, और inference के दौरान हर token पर 13 अरब parameters सक्रिय होने वाली Mixture of Experts(MoE) संरचना का उपयोग होता है
  • मॉडल weights डाउनलोड करके self-host किया जा सकता है
  • MIT लाइसेंस लागू है, इसलिए commercial use की अनुमति है
  • यह अधिकतम reasoning effort (Max Effort) का उपयोग करने वाला reasoning version है, और अलग non-reasoning version भी मौजूद हो सकता है

बुद्धिमत्ता मूल्यांकन

  • Artificial Analysis Intelligence Index v4.1 में इसने 50 अंक हासिल किए
    • Kimi K3 (max), GLM-5.2 (max) के बाद तीसरा स्थान। इसके बाद Kimi K3 (low), MiniMax-M3 चौथे/पांचवें स्थान पर हैं
    • समान श्रेणी के बड़े open-weight मॉडलों का median 25 अंक है
    • Artificial Analysis इसे बुद्धिमत्ता के लिहाज़ से अग्रणी मॉडल समूह में रखता है
  • Intelligence Index v4.1 निम्न 9 मूल्यांकनों को मिलाकर बनता है
    • GDPval-AA v2: agentic वास्तविक कार्य
    • 𝜏³-Banking: agentic tool use
    • Terminal-Bench v2.1: agentic coding/terminal use
    • SciCode: coding
    • Humanity's Last Exam: reasoning/knowledge
    • GPQA Diamond: वैज्ञानिक reasoning
    • CritPt: physics reasoning
    • AA-Omniscience: ज्ञान शुद्धता और hallucination suppression
    • AA-LCR: long-context reasoning

अतिरिक्त benchmark दायरा

  • मॉडल-वार विस्तृत उपयोगों की तुलना के लिए निम्न मूल्यांकन परिणाम भी दिए गए हैं
    • AA-Briefcase: agentic knowledge work
    • AutomationBench-AA: SaaS कार्य automation
    • Harvey LAB-AA: legal agent कार्य
    • EnterpriseOps-Gym-AA: enterprise operations कार्य
    • IFBench: instruction following
    • APEX-Agents-AA: लंबे समय वाले agent कार्य
    • ITBench-AA: Kubernetes fault root-cause analysis
    • MMMU-Pro: visual reasoning
  • DeepSeek V4 Flash 0731 image input को support नहीं करता, इसलिए यह text-only मॉडल है और multimodal मॉडल नहीं है

ज्ञान विश्वसनीयता और hallucination मूल्यांकन

  • AA-Omniscience Index सही उत्तरों को अंक देता है और hallucination पर penalty लगाता है, जबकि उत्तर देने से इनकार करने पर penalty नहीं लगती
  • स्कोर रेंज -100 से 100 तक है
    • 0 अंक का मतलब है कि सही और गलत उत्तरों की संख्या बराबर है
    • नकारात्मक स्कोर का मतलब है कि सही उत्तरों से ज्यादा गलत उत्तर हैं

token उपयोग और response विशेषताएँ

  • Intelligence Index के पूरे मूल्यांकन में इसने 21 करोड़ output tokens उत्पन्न किए
    • समान श्रेणी के open-weight मॉडलों का median 10 करोड़ tokens है
    • Artificial Analysis ने इसे बहुत अधिक verbose स्तर में वर्गीकृत किया है
  • प्रति कार्य output tokens की संख्या, हर benchmark के output volume पर Intelligence Index weighting लागू करके और reruns को छोड़कर कार्यों की संख्या से विभाजित करके निकाली जाती है
  • output speed अभी मापी नहीं गई है, इसलिए प्रति सेकंड output tokens सार्वजनिक नहीं हैं

API कीमत और मूल्यांकन लागत

  • DeepSeek API के आधार पर कीमतें इस प्रकार हैं
    • input: 10 लाख token पर $0.14
    • output: 10 लाख token पर $0.28
    • cache hit: 10 लाख token पर $0.003
  • cache hit/input/output को 7:2:1 अनुपात में मिलाने पर 10 लाख token की कीमत $0.06 होती है
  • Intelligence Index के पूरे मूल्यांकन की लागत $72.02 थी
  • summary सेक्शन में तुलना वाले मॉडलों का median input $0.43/output $1.20 के रूप में दिखाया गया है, और FAQ सेक्शन में input $0.58/output $2.20 के रूप में
  • प्रति कार्य लागत, input, cache hit, cache write, reasoning और final answer token लागत को कार्यों की संख्या से विभाजित करके, फिर हर benchmark की Index weighting लागू करके निकाली जाती है
  • cache write और storage लागत API provider के अनुसार अलग से वसूली जा सकती है

context और उपलब्धता का दायरा

  • context window 10 लाख token की है, जो 12-point Arial के आधार पर लगभग A4 के 1,500 पन्नों के बराबर है
  • इसे बड़े दस्तावेज़ खोज और reasoning की जरूरत वाले RAG workflow में इस्तेमाल किया जा सकता है
  • यह सिर्फ text input और text output को support करता है
  • फिलहाल API देने वाला provider 1 ही है, और provider के अनुसार कीमतें अलग हो सकती हैं

1 टिप्पणियां

 
GN⁺ 2 시간 전
Hacker News की राय
  • model weights अभी-अभी जारी हुए हैं: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • DwarfStar quantization version का इंतज़ार है। 128GB MacBook Pro पर मैंने कई महीनों तक DeepSeek V4 Flash preview को अपने मुख्य coding agent के रूप में इस्तेमाल किया, और यह लगभग हर metric में GLM 5.2 से बेहतर लगता है
    • यह 128×128 matrix multiplication primitives वाले hardware accelerators को target करता है; सोच रहा हूँ क्या इसका मतलब H100 का Warp Group Matrix Multiply Accumulate है
    • अगर 165GB से कम Unsloth GGUF है, तो इसे 256GB RAM वाले ज़्यादातर CPU-only systems पर चलाया जा सकता है। llama-server के साथ 32GB·48GB·96GB GPU पर जितना हो सके उतना लोड करके बाकी को system DRAM में रखने वाला hybrid setup भी संभव है
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • नया DeepSeek model क्रिसमस गिफ्ट जैसा लग रहा है। low-cost API models DeepSeek सबसे अच्छा करता है, और जब तक VRAM की कीमतें इतनी नहीं गिरतीं कि local run व्यावहारिक हो जाए, तब तक यही सबसे अच्छा तरीका है
    subsidy पर टिका subscription model ज़्यादा लंबे समय तक चलना मुश्किल है, और API billing ज़्यादा sustainable business model के करीब लगती है

    • मैं एक project में DeepSeek इस्तेमाल कर रहा हूँ, और करोड़ों tokens को कुछ cents में इस्तेमाल कर पाना हैरान करने वाला है। यह हर काम के लिए सही नहीं है, लेकिन कुछ खास काम यह लगभग मुफ्त जैसी लागत पर शानदार तरीके से कर देता है
    • उस दिन का इंतज़ार है जब चीन memory और compute hardware में बराबरी पर आकर अमेरिकी कंपनियों को कीमत और performance दोनों में पीछे छोड़ देगा
    • साथी developers शिकायत करते हैं कि वे Claude tokens एक घंटे में खत्म कर देते हैं, लेकिन मैं DS Flash को पूरे दिन इस्तेमाल करता हूँ। कभी-कभी अगर यह गलत हो जाए, तभी मुश्किल काम के लिए Claude जैसे models निकालने पड़ते हैं
    • token के हिसाब से देखें तो DeepSeek API subscription से ज़्यादा cost-effective होने की अच्छी संभावना है। मैंने खुद test किया है; Flash की instruction-following काफ़ी बेहतर हुई है और यह ज़्यादा proactive भी हो गया है, इसलिए अभी cost efficiency में इसके बराबर के models बहुत कम हैं
    • सीधे pricing देखें तो GPT 5.6 Luna जैसा result देने के लिए इसे 5 गुना ज़्यादा tokens चाहिए होते हैं, और tokens per second भी काफ़ी कम है। फिर भी DeepSeek के दबाव की वजह से incumbents लगातार optimize करते रहें, यह असर साफ़ दिखता है
  • पुराना address 404 दे रहा है, और सही URL यह लगता है: https://artificialanalysis.ai/models/deepseek-v4-flash

  • कल जारी किए गए OpenAI chart में DeepSeek V4 Flash 0731 data point जोड़ दिया गया है, और यह price-performance frontier पर है
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    मूल: https://openai.com/index/advancing-the-price-performance-fro...

  • कहा गया है कि public benchmarks के code agent tasks में अभी रिलीज़ न किए गए DeepSeek Harness minimal mode का इस्तेमाल हुआ, तो सोच रहा हूँ क्या optimized coding agent harness भी जारी करने की योजना है
    DSv4 Flash को reasonix या pi के साथ इस्तेमाल करें तो token की चिंता के बिना पूरे दिन कुछ cents में coding की जा सकती है। दूसरी तरफ़, उसी model को Fireworks या OpenRouter पर ZDR के साथ इस्तेमाल करें तो बिना वजह लागत बढ़ती रहती है। लगता है usage data इकट्ठा करने के लिए pricing को subsidize किया जा रहा है; local run संभव होने का दिन इंतज़ार में है

    • अगर OpenRouter के ज़रिए नहीं, तो किस provider से खरीदते हैं, यह जानना चाहूँगा। मेरी समझ थी कि अगर provider OpenRouter पर listed है, तो सीधे खरीदने पर भी कीमत वही होती है
    • tech report में DeepSeek Harness का संकेत पहले ही दिया गया था। code agent tasks का evaluation minimal mode, maximum reasoning effort, temperature = 1.0, top_p = 0.95 पर किया गया था, और harness बाद में जारी होने वाला है
  • RTX PRO 6000 96GB या DGX Spark 128GB users के लिए कम चर्चित vllm-moet बहुत अच्छा engine है। यह inference के लिए symmetric 2-bit planes अपने-आप बनाता है, precision recovery के लिए 4-bit delta cache भी बनाता है, और RAM से बड़े weights के लिए SSD streaming को support करता है
    आप हर क्षेत्र को कितना VRAM देना है यह तय करके speed और precision का संतुलन बना सकते हैं, और DS V4 Flash पर 170 tokens per second का demo दिखाया गया है। किसी अलग converted model के बिना, original model को जैसा है वैसा ही इस्तेमाल किया जाता है
    DGX Spark पर sm120 और sm121 के फ़र्क को नज़रअंदाज़ करने वाला एक छोटा workaround चाहिए, लेकिन sm121 पर भी यह चल जाता है, इसलिए कुछ घंटे लगाना काफ़ी फायदेमंद हो सकता है

  • प्रति 10 लाख output tokens पर $0.28 में GLM 5.2·Gemini 3.6-स्तर की intelligence मिलती है, और updated Pro model भी जल्द आने वाला है
    Unsloth lossless Q8 का आकार 162GB है, इसलिए यह सच में घर पर चलाने लायक size है

    • इतना कुछ घर पर चलाने वाला घर कैसा होगा, यह देखना चाहूँगा
    • Q8 का size लगभग 151GB है
  • अगर DeepSeek V4 Flash, V4 Pro से आगे निकलता है, तो क्या कुछ हफ्तों में Opus 5-स्तर का V4 Pro भी देखने को मिल सकता है? Opus से बेहतर हो तो और भी अच्छा होगा

    • मैं जो app बना रहा हूँ उसमें V4 Flash इस्तेमाल कर रहा हूँ, और GPT·Opus·Sonnet से आकर इस पर स्विच करने के बाद इसकी cost efficiency और performance चौंकाने वाली लगी। लागत इतनी कम है कि जिन apps का मकसद revenue नहीं है, वे भी आराम से generous free tier दे सकते हैं
      https://trysojourn.app
    • V4 Pro की कीमत पर Opus 5 performance अविश्वसनीय रूप से बढ़िया होगा, लेकिन शायद यह ज़्यादा सपना ही है
    • कहा गया है कि updated V4 Pro final version जल्द जारी होगा
  • सच में दिलचस्प बात यह है कि architecture बदले बिना सिर्फ़ अतिरिक्त fine-tuning से इतना बड़ा performance improvement हासिल किया गया। यह ज़्यादा data, compute और time लगाने का नतीजा है
    DS V4 Flash प्रतिस्पर्धी model family की तुलना में काफ़ी छोटा है, इसलिए लगता है कि high-quality data और training pipeline को दूसरे छोटे models पर लागू करने से भी ऐसा ही improvement मिल सकता है

  • price per task में यह पहले ही Luna से लगभग 2 गुना आगे है: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • यह भी देखना चाहूँगा कि Luna के साथ अलग-अलग task types में इसका comparison कैसा है
    • क्योंकि cost X-axis पर है, इसलिए सटीक रूप से देखें तो DeepSeek V4 Flash 0731 maximum reasoning लगभग $0.03 per task और index 50 पर है। OpenAI Luna में high reasoning $0.03·index 46, ultra-high reasoning $0.04·index 49, और maximum reasoning $0.07·index 51 है
      इसलिए यह कहना ज़्यादा उचित होगा कि Luna, DeepSeek Flash से 2~3 गुना महँगा है लेकिन reasoning speed 2~5 गुना तेज़ है। DeepSeek से बेहतर करने वाला सबसे सस्ता OpenAI model Luna maximum reasoning है, जो लगभग समान performance पर rounding से पहले करीब 3 गुना महँगा है, लेकिन speed भी लगभग 3 गुना तेज़ है
      Artificial Analysis ने DeepSeek और OpenAI दोनों के लिए गहरा नीला रंग इस्तेमाल किया है, जो खासकर आज जैसे दिन में बहुत ही अनुचित color choice है