- DeepSeek-V4-Flash API का आधिकारिक संस्करण 31 जुलाई 2026 को public beta के रूप में जारी हुआ, और मौजूदा call method में सिर्फ model name को
deepseek-v4-flashसेट करके इसका उपयोग किया जा सकता है - agent performance ने V4-Pro-Preview को काफी पीछे छोड़ दिया और Terminal Bench 2.1 में 82.7 अंक सहित Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7 दर्ज किए
- code agent benchmark को जल्द जारी होने वाले DeepSeek Harness minimal mode में max effort,
top_p=0.95,temperature=1.0शर्तों पर मापा गया - आधिकारिक V4-Flash Responses API format को default रूप से support करता है और Codex के अनुसार समायोजित किया गया है, जबकि Preview जैसी ही model structure/size रखकर सिर्फ post-training लागू की गई है
- बदलाव का दायरा सिर्फ V4-Flash API तक सीमित है; V4-Pro API और APP/WEB model वैसे ही रहेंगे, और V4-Pro का आधिकारिक संस्करण जल्द जारी होगा
public beta रिलीज़ और API उपयोग विधि
- DeepSeek-V4-Flash API का आधिकारिक संस्करण 31 जुलाई 2026 को public beta के रूप में जारी हुआ
- मौजूदा call method वैसा ही रहेगा, और model parameter को
deepseek-v4-flashपर सेट करने से latest version इस्तेमाल किया जा सकेगा - V4 series को पहले की तरह उसी
base_urlपर OpenAI ChatCompletions और Anthropic interface के जरिए उपलब्ध कराया गया है- V4-Pro के लिए
deepseek-v4-pro, V4-Flash के लिएdeepseek-v4-flashइस्तेमाल होता है - पुराने model name
deepseek-chatऔरdeepseek-reasonerको 24 जुलाई 2026 को बंद किया जाना तय था - transition period के दौरान ये दोनों नाम क्रमशः V4-Flash के non-thinking mode और thinking mode को दर्शाते थे
- V4-Pro के लिए
agent benchmark परिणाम
- V4-Flash के आधिकारिक संस्करण ने agent performance में V4-Pro-Preview से काफी बेहतर परिणाम दर्ज किए
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench Public: 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
- public benchmark के code agent tasks को जल्द जारी होने वाले DeepSeek Harness minimal mode में मापा गया
- effort level max था और
top_p=0.95,temperature=1.0पर सेट किया गया था
- effort level max था और
- DSBench-FullStack internal full-stack development test set है, और DSBench-Hard internal coding agent high-difficulty problem set है
Responses API और Codex एकीकरण
- आधिकारिक V4-Flash Responses API format को default रूप से support करता है और Codex के अनुसार समायोजित किया गया है
- Codex integration के लिए ज़रूरी settings आधिकारिक दस्तावेज़ में देखी जा सकती हैं
model बदलाव का दायरा
DeepSeek-V4-Flash-0731V4-Flash-Preview जैसी उसी model structure और size को बनाए रखता है- model की संरचना में बदलाव किए बिना सिर्फ post-training लागू की गई है
- यह अपडेट केवल DeepSeek-V4-Flash API पर लागू होता है
- DeepSeek-V4-Pro API में कोई बदलाव नहीं है
- APP/WEB में उपलब्ध model भी वैसे ही बने रहेंगे
- DeepSeek-V4-Pro का आधिकारिक संस्करण जल्द जारी होने वाला है
1 टिप्पणियां
Hacker News की राय
निजी तौर पर K3 से ज़्यादा उम्मीद इसी से है। DSV4 मॉडल की serving cost बहुत कम है, इसलिए performance बेहतर होने पर यह और ज़्यादा कामों में ‘काफ़ी अच्छा’ मॉडल बन सकता है
DeepSeek लंबे समय से Pro version बहुत सस्ते में देता रहा है और OpenCode आदि के साथ integration भी किया है, इसलिए संभव है कि उसने वास्तविक development work का काफ़ी data भी इकट्ठा किया हो। अगर इसे post-training में इस्तेमाल किया जाए तो और सुधार भी संभव है
यह भी जानने की उत्सुकता है कि K3 को DSV4 में distill करने पर वह कितना बेहतर होगा। सस्ते और तेज़ मॉडल community के लिए खास तौर पर फ़ायदेमंद हैं, क्योंकि provider की मर्ज़ी से वे अचानक गायब नहीं होते और उनकी performance का इस्तेमाल करते रहना संभव होता है। कम से कम Flash तो 10,000 डॉलर से कम के hardware पर घर में भी चल सकता है, लेकिन GLM या K3 जैसे बड़े मॉडल व्यावहारिक रूप से मुश्किल हैं
मैं अपने 90% काम Flash से कर रहा हूँ। वजह नहीं पता, लेकिन यह Pro से बेहतर है, और बहुत सस्ता व तेज़ है
अगर बदलाव 1,000 lines से कम रखें और architecture के फ़ैसले खुद लें, तो cutting-edge models से फ़र्क़ लगभग महसूस नहीं होता। बाकी 10% का इस्तेमाल bug·security issues ढूँढने या बेहतर structure की समीक्षा में करता हूँ, और Flash भी इसमें काफ़ी अच्छा है, लेकिन cross-validation कर रहा हूँ
छोटे बदलावों के लिए हर बार 5~10 मिनट इंतज़ार करने से तेज़ iteration कहीं बेहतर है। हाल में Kimi और GLM बेवजह बहुत देर तक inference करते रहे, इसलिए धीमे लगे। dependencies, logs, performance dump जैसे बहुत सारा data limits की चिंता के बिना डाला जा सकता है, और binary reverse engineering में भी security restrictions नहीं लगतीं
दूसरी ओर, कुछ लोग कहते हैं कि security से असंबंधित prompts भी reject हो जाते हैं, इसलिए सोचता हूँ कि platform और user के हिसाब से इतना फ़र्क़ कैसे हो सकता है
Claude Code की तुलना में कम tokens इस्तेमाल करने वाले OpenCode का ज़्यादा उपयोग करता हूँ, और DeepSeek का अपना coding harness आने का भी इंतज़ार है
निजी रोज़मर्रा के agent कामों के लिए DeepSeek इस्तेमाल करने के पिछले 30 दिनों का रिकॉर्ड है: लागत 4.55 डॉलर, API requests 3,467, tokens 323,183,886
एक छोटे team को lead करने वाले engineer के रूप में मेरे quality standards ऊँचे हैं, और निजी projects पर भी वही standards लागू करता हूँ, लेकिन coding और review tasks में मुझे बिल्कुल निराशा नहीं हुई। बाकी कामों के लिए दूसरे models इस्तेमाल करता हूँ
अब pi के अंदर लगभग हर काम Flash से चलाता हूँ। सही MCP server, context reduction tools और skills हों तो कोई भी काम implement किया जा सकता है
कुछ sessions 30 turns से ज़्यादा लेते हैं, लेकिन यह तेज़ और सस्ता है, इसलिए एक घंटे तक काम करने पर भी लगभग 0.5 डॉलर काफ़ी होते हैं। हालांकि multi-subagent workflows में planning·review·oracle roles के लिए महंगे models भी इस्तेमाल करता हूँ
धीमी Opus subscription को कई हफ़्तों से इस्तेमाल नहीं किया। फ़ोन पर भी चलने वाला, MCP और skills support करने वाला self-hosted OpenWebUI chat भी बना लिया है, जिसने Perplexity को पूरी तरह replace कर दिया है, और hosting व subscription cost मिलाकर लगभग 18 डॉलर प्रति माह है
top_pऔरtemperatureकैसे सेट करें, यह जानना चाहता हूँअगर benchmark वास्तव में real-world performance को ठीक से दर्शाता है, तो यह चौंकाने वाला मॉडल है। 300B मॉडल पिछले DS4 Pro preview model के 1.8T parameters वाले performance को पार करता है और GPT 5.6 Luna से भी बेहतर दिखता है
price cut के बाद वाली Luna से भी यह अब भी सस्ता है
200B मॉडल का GLM-5.2 से टक्कर लेना और Opus 4.8 के करीब पहुँचना काफ़ी प्रभावशाली है
अगर ये आँकड़े general performance में भी दिखाई दें और DeepSeek की शानदार caching भी जुड़ जाए, तो इसका उपयोग बहुत बढ़ सकता है
सोचता हूँ कि इसे और स्पष्ट रूप से अलग दिखाने के लिए
v4.1-Flashक्यों नहीं कहा गयाअगर यह speed और कम कीमत बनाए रखते हुए पहले से ही काफ़ी उपयोगी deepseek-v4-pro की performance को भी पार कर जाए, तो यह बहुत आशाजनक है
deepseek-v4-flash पहले से ही price-to-performance के हिसाब से सबसे अच्छा मॉडल था, इसलिए intelligence/cost metric में अंतर और बढ़ सकता है। हालाँकि DeepSeek API की सस्ती लागत का एक मतलब यह भी है कि codebase की जानकारी चीन तक जाती है
महंगे कामों के लिए Opus की जगह Kimi K3, और सामान्य कामों के लिए Sonnet की जगह DSV4 Flash इस्तेमाल करना क्या उचित setup है?
coding के अलावा दूसरे उपयोग वाले agents में DSv4 के इस्तेमाल के उदाहरण जानना चाहता हूँ। खासकर वे लोग जो GPT-5.4 mini से classification या categorization आदि कर रहे थे, वे DSv4 को कैसे इस्तेमाल कर रहे हैं, यह जानना चाहता हूँ