- अधिकतम reasoning सेटिंग ने AAII में 50 अंक हासिल किए, जिससे यह Kimi K3 (max) और GLM-5.2 (max) के बाद तीसरे स्थान पर है
- यह 284 अरब कुल parameters वाला एक MoE मॉडल है, जिसमें हर token पर सिर्फ 13 अरब parameters सक्रिय होते हैं, और यह text input/output तथा 10 लाख token context को support करता है
- API कीमत 10 लाख token पर input $0.14, output $0.28, cache hit $0.003 है, और Intelligence Index के पूरे मूल्यांकन की लागत $72.02 थी
- मूल्यांकन के दौरान इसने 21 करोड़ output tokens का उपयोग किया, जो समान श्रेणी के मॉडलों के 10 करोड़ median से काफी अधिक था, और output speed अभी सार्वजनिक नहीं है
- मॉडल weights सार्वजनिक हैं और MIT लाइसेंस लागू है, इसलिए self-hosting और commercial use संभव है, और फिलहाल API provider 1 ही है
मॉडल संरचना और सार्वजनिक रिलीज़ का तरीका
- DeepSeek V4 Flash 0731 31 जुलाई 2026 को जारी किया गया एक reasoning open-weight मॉडल है
- इसमें कुल 284 अरब parameters हैं, और inference के दौरान हर token पर 13 अरब parameters सक्रिय होने वाली Mixture of Experts(MoE) संरचना का उपयोग होता है
- मॉडल weights डाउनलोड करके self-host किया जा सकता है
- MIT लाइसेंस लागू है, इसलिए commercial use की अनुमति है
- यह अधिकतम reasoning effort (Max Effort) का उपयोग करने वाला reasoning version है, और अलग non-reasoning version भी मौजूद हो सकता है
बुद्धिमत्ता मूल्यांकन
- Artificial Analysis Intelligence Index v4.1 में इसने 50 अंक हासिल किए
- Kimi K3 (max), GLM-5.2 (max) के बाद तीसरा स्थान। इसके बाद Kimi K3 (low), MiniMax-M3 चौथे/पांचवें स्थान पर हैं
- समान श्रेणी के बड़े open-weight मॉडलों का median 25 अंक है
- Artificial Analysis इसे बुद्धिमत्ता के लिहाज़ से अग्रणी मॉडल समूह में रखता है
- Intelligence Index v4.1 निम्न 9 मूल्यांकनों को मिलाकर बनता है
- GDPval-AA v2: agentic वास्तविक कार्य
- 𝜏³-Banking: agentic tool use
- Terminal-Bench v2.1: agentic coding/terminal use
- SciCode: coding
- Humanity's Last Exam: reasoning/knowledge
- GPQA Diamond: वैज्ञानिक reasoning
- CritPt: physics reasoning
- AA-Omniscience: ज्ञान शुद्धता और hallucination suppression
- AA-LCR: long-context reasoning
अतिरिक्त benchmark दायरा
- मॉडल-वार विस्तृत उपयोगों की तुलना के लिए निम्न मूल्यांकन परिणाम भी दिए गए हैं
- AA-Briefcase: agentic knowledge work
- AutomationBench-AA: SaaS कार्य automation
- Harvey LAB-AA: legal agent कार्य
- EnterpriseOps-Gym-AA: enterprise operations कार्य
- IFBench: instruction following
- APEX-Agents-AA: लंबे समय वाले agent कार्य
- ITBench-AA: Kubernetes fault root-cause analysis
- MMMU-Pro: visual reasoning
- DeepSeek V4 Flash 0731 image input को support नहीं करता, इसलिए यह text-only मॉडल है और multimodal मॉडल नहीं है
ज्ञान विश्वसनीयता और hallucination मूल्यांकन
- AA-Omniscience Index सही उत्तरों को अंक देता है और hallucination पर penalty लगाता है, जबकि उत्तर देने से इनकार करने पर penalty नहीं लगती
- स्कोर रेंज -100 से 100 तक है
- 0 अंक का मतलब है कि सही और गलत उत्तरों की संख्या बराबर है
- नकारात्मक स्कोर का मतलब है कि सही उत्तरों से ज्यादा गलत उत्तर हैं
token उपयोग और response विशेषताएँ
- Intelligence Index के पूरे मूल्यांकन में इसने 21 करोड़ output tokens उत्पन्न किए
- समान श्रेणी के open-weight मॉडलों का median 10 करोड़ tokens है
- Artificial Analysis ने इसे बहुत अधिक verbose स्तर में वर्गीकृत किया है
- प्रति कार्य output tokens की संख्या, हर benchmark के output volume पर Intelligence Index weighting लागू करके और reruns को छोड़कर कार्यों की संख्या से विभाजित करके निकाली जाती है
- output speed अभी मापी नहीं गई है, इसलिए प्रति सेकंड output tokens सार्वजनिक नहीं हैं
API कीमत और मूल्यांकन लागत
- DeepSeek API के आधार पर कीमतें इस प्रकार हैं
- input: 10 लाख token पर $0.14
- output: 10 लाख token पर $0.28
- cache hit: 10 लाख token पर $0.003
- cache hit/input/output को 7:2:1 अनुपात में मिलाने पर 10 लाख token की कीमत $0.06 होती है
- Intelligence Index के पूरे मूल्यांकन की लागत $72.02 थी
- summary सेक्शन में तुलना वाले मॉडलों का median input $0.43/output $1.20 के रूप में दिखाया गया है, और FAQ सेक्शन में input $0.58/output $2.20 के रूप में
- प्रति कार्य लागत, input, cache hit, cache write, reasoning और final answer token लागत को कार्यों की संख्या से विभाजित करके, फिर हर benchmark की Index weighting लागू करके निकाली जाती है
- cache write और storage लागत API provider के अनुसार अलग से वसूली जा सकती है
context और उपलब्धता का दायरा
- context window 10 लाख token की है, जो 12-point Arial के आधार पर लगभग A4 के 1,500 पन्नों के बराबर है
- इसे बड़े दस्तावेज़ खोज और reasoning की जरूरत वाले RAG workflow में इस्तेमाल किया जा सकता है
- यह सिर्फ text input और text output को support करता है
- फिलहाल API देने वाला provider 1 ही है, और provider के अनुसार कीमतें अलग हो सकती हैं
1 टिप्पणियां
Hacker News की राय
model weights अभी-अभी जारी हुए हैं: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-serverके साथ 32GB·48GB·96GB GPU पर जितना हो सके उतना लोड करके बाकी को system DRAM में रखने वाला hybrid setup भी संभव हैhttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
नया DeepSeek model क्रिसमस गिफ्ट जैसा लग रहा है। low-cost API models DeepSeek सबसे अच्छा करता है, और जब तक VRAM की कीमतें इतनी नहीं गिरतीं कि local run व्यावहारिक हो जाए, तब तक यही सबसे अच्छा तरीका है
subsidy पर टिका subscription model ज़्यादा लंबे समय तक चलना मुश्किल है, और API billing ज़्यादा sustainable business model के करीब लगती है
पुराना address 404 दे रहा है, और सही URL यह लगता है: https://artificialanalysis.ai/models/deepseek-v4-flash
कल जारी किए गए OpenAI chart में DeepSeek V4 Flash 0731 data point जोड़ दिया गया है, और यह price-performance frontier पर है
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
मूल: https://openai.com/index/advancing-the-price-performance-fro...
कहा गया है कि public benchmarks के code agent tasks में अभी रिलीज़ न किए गए DeepSeek Harness minimal mode का इस्तेमाल हुआ, तो सोच रहा हूँ क्या optimized coding agent harness भी जारी करने की योजना है
DSv4 Flash को reasonix या pi के साथ इस्तेमाल करें तो token की चिंता के बिना पूरे दिन कुछ cents में coding की जा सकती है। दूसरी तरफ़, उसी model को Fireworks या OpenRouter पर ZDR के साथ इस्तेमाल करें तो बिना वजह लागत बढ़ती रहती है। लगता है usage data इकट्ठा करने के लिए pricing को subsidize किया जा रहा है; local run संभव होने का दिन इंतज़ार में है
temperature = 1.0,top_p = 0.95पर किया गया था, और harness बाद में जारी होने वाला हैRTX PRO 6000 96GB या DGX Spark 128GB users के लिए कम चर्चित vllm-moet बहुत अच्छा engine है। यह inference के लिए symmetric 2-bit planes अपने-आप बनाता है, precision recovery के लिए 4-bit delta cache भी बनाता है, और RAM से बड़े weights के लिए SSD streaming को support करता है
आप हर क्षेत्र को कितना VRAM देना है यह तय करके speed और precision का संतुलन बना सकते हैं, और DS V4 Flash पर 170 tokens per second का demo दिखाया गया है। किसी अलग converted model के बिना, original model को जैसा है वैसा ही इस्तेमाल किया जाता है
DGX Spark पर
sm120औरsm121के फ़र्क को नज़रअंदाज़ करने वाला एक छोटा workaround चाहिए, लेकिनsm121पर भी यह चल जाता है, इसलिए कुछ घंटे लगाना काफ़ी फायदेमंद हो सकता हैप्रति 10 लाख output tokens पर $0.28 में GLM 5.2·Gemini 3.6-स्तर की intelligence मिलती है, और updated Pro model भी जल्द आने वाला है
Unsloth lossless Q8 का आकार 162GB है, इसलिए यह सच में घर पर चलाने लायक size है
अगर DeepSeek V4 Flash, V4 Pro से आगे निकलता है, तो क्या कुछ हफ्तों में Opus 5-स्तर का V4 Pro भी देखने को मिल सकता है? Opus से बेहतर हो तो और भी अच्छा होगा
https://trysojourn.app
सच में दिलचस्प बात यह है कि architecture बदले बिना सिर्फ़ अतिरिक्त fine-tuning से इतना बड़ा performance improvement हासिल किया गया। यह ज़्यादा data, compute और time लगाने का नतीजा है
DS V4 Flash प्रतिस्पर्धी model family की तुलना में काफ़ी छोटा है, इसलिए लगता है कि high-quality data और training pipeline को दूसरे छोटे models पर लागू करने से भी ऐसा ही improvement मिल सकता है
price per task में यह पहले ही Luna से लगभग 2 गुना आगे है: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
इसलिए यह कहना ज़्यादा उचित होगा कि Luna, DeepSeek Flash से 2~3 गुना महँगा है लेकिन reasoning speed 2~5 गुना तेज़ है। DeepSeek से बेहतर करने वाला सबसे सस्ता OpenAI model Luna maximum reasoning है, जो लगभग समान performance पर rounding से पहले करीब 3 गुना महँगा है, लेकिन speed भी लगभग 3 गुना तेज़ है
Artificial Analysis ने DeepSeek और OpenAI दोनों के लिए गहरा नीला रंग इस्तेमाल किया है, जो खासकर आज जैसे दिन में बहुत ही अनुचित color choice है