1 पॉइंट द्वारा GN⁺ 2 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • DeepSeek-V4-Flash API का आधिकारिक संस्करण 31 जुलाई 2026 को public beta के रूप में जारी हुआ, और मौजूदा call method में सिर्फ model name को deepseek-v4-flash सेट करके इसका उपयोग किया जा सकता है
  • agent performance ने V4-Pro-Preview को काफी पीछे छोड़ दिया और Terminal Bench 2.1 में 82.7 अंक सहित Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7 दर्ज किए
  • code agent benchmark को जल्द जारी होने वाले DeepSeek Harness minimal mode में max effort, top_p=0.95, temperature=1.0 शर्तों पर मापा गया
  • आधिकारिक V4-Flash Responses API format को default रूप से support करता है और Codex के अनुसार समायोजित किया गया है, जबकि Preview जैसी ही model structure/size रखकर सिर्फ post-training लागू की गई है
  • बदलाव का दायरा सिर्फ V4-Flash API तक सीमित है; V4-Pro API और APP/WEB model वैसे ही रहेंगे, और V4-Pro का आधिकारिक संस्करण जल्द जारी होगा

public beta रिलीज़ और API उपयोग विधि

  • DeepSeek-V4-Flash API का आधिकारिक संस्करण 31 जुलाई 2026 को public beta के रूप में जारी हुआ
  • मौजूदा call method वैसा ही रहेगा, और model parameter को deepseek-v4-flash पर सेट करने से latest version इस्तेमाल किया जा सकेगा
  • V4 series को पहले की तरह उसी base_url पर OpenAI ChatCompletions और Anthropic interface के जरिए उपलब्ध कराया गया है
    • V4-Pro के लिए deepseek-v4-pro, V4-Flash के लिए deepseek-v4-flash इस्तेमाल होता है
    • पुराने model name deepseek-chat और deepseek-reasoner को 24 जुलाई 2026 को बंद किया जाना तय था
    • transition period के दौरान ये दोनों नाम क्रमशः V4-Flash के non-thinking mode और thinking mode को दर्शाते थे

agent benchmark परिणाम

  • V4-Flash के आधिकारिक संस्करण ने agent performance में V4-Pro-Preview से काफी बेहतर परिणाम दर्ज किए
    • Terminal Bench 2.1: 82.7
    • NL2Repo: 54.2
    • Cybergym: 76.7
    • DeepSWE: 54.4
    • Toolathlon verified: 70.3
    • Agent Last Exam: 25.2
    • Automation Bench Public: 25.1
    • DSBench-FullStack: 68.7
    • DSBench-Hard: 59.6
  • public benchmark के code agent tasks को जल्द जारी होने वाले DeepSeek Harness minimal mode में मापा गया
    • effort level max था और top_p=0.95, temperature=1.0 पर सेट किया गया था
  • DSBench-FullStack internal full-stack development test set है, और DSBench-Hard internal coding agent high-difficulty problem set है

Responses API और Codex एकीकरण

  • आधिकारिक V4-Flash Responses API format को default रूप से support करता है और Codex के अनुसार समायोजित किया गया है
  • Codex integration के लिए ज़रूरी settings आधिकारिक दस्तावेज़ में देखी जा सकती हैं

model बदलाव का दायरा

  • DeepSeek-V4-Flash-0731 V4-Flash-Preview जैसी उसी model structure और size को बनाए रखता है
  • model की संरचना में बदलाव किए बिना सिर्फ post-training लागू की गई है
  • यह अपडेट केवल DeepSeek-V4-Flash API पर लागू होता है
    • DeepSeek-V4-Pro API में कोई बदलाव नहीं है
    • APP/WEB में उपलब्ध model भी वैसे ही बने रहेंगे
  • DeepSeek-V4-Pro का आधिकारिक संस्करण जल्द जारी होने वाला है

1 टिप्पणियां

 
GN⁺ 2 시간 전
Hacker News की राय
  • निजी तौर पर K3 से ज़्यादा उम्मीद इसी से है। DSV4 मॉडल की serving cost बहुत कम है, इसलिए performance बेहतर होने पर यह और ज़्यादा कामों में ‘काफ़ी अच्छा’ मॉडल बन सकता है
    DeepSeek लंबे समय से Pro version बहुत सस्ते में देता रहा है और OpenCode आदि के साथ integration भी किया है, इसलिए संभव है कि उसने वास्तविक development work का काफ़ी data भी इकट्ठा किया हो। अगर इसे post-training में इस्तेमाल किया जाए तो और सुधार भी संभव है
    यह भी जानने की उत्सुकता है कि K3 को DSV4 में distill करने पर वह कितना बेहतर होगा। सस्ते और तेज़ मॉडल community के लिए खास तौर पर फ़ायदेमंद हैं, क्योंकि provider की मर्ज़ी से वे अचानक गायब नहीं होते और उनकी performance का इस्तेमाल करते रहना संभव होता है। कम से कम Flash तो 10,000 डॉलर से कम के hardware पर घर में भी चल सकता है, लेकिन GLM या K3 जैसे बड़े मॉडल व्यावहारिक रूप से मुश्किल हैं

    • training data देने की सहमति जिन providers को दी जा सकती है, वे DeepSeek और Moonshot ही हैं
    • DwarfStar के साथ मिलाकर काम की local AI बन सकेगी, ऐसी उम्मीद है
  • मैं अपने 90% काम Flash से कर रहा हूँ। वजह नहीं पता, लेकिन यह Pro से बेहतर है, और बहुत सस्ता व तेज़ है
    अगर बदलाव 1,000 lines से कम रखें और architecture के फ़ैसले खुद लें, तो cutting-edge models से फ़र्क़ लगभग महसूस नहीं होता। बाकी 10% का इस्तेमाल bug·security issues ढूँढने या बेहतर structure की समीक्षा में करता हूँ, और Flash भी इसमें काफ़ी अच्छा है, लेकिन cross-validation कर रहा हूँ
    छोटे बदलावों के लिए हर बार 5~10 मिनट इंतज़ार करने से तेज़ iteration कहीं बेहतर है। हाल में Kimi और GLM बेवजह बहुत देर तक inference करते रहे, इसलिए धीमे लगे। dependencies, logs, performance dump जैसे बहुत सारा data limits की चिंता के बिना डाला जा सकता है, और binary reverse engineering में भी security restrictions नहीं लगतीं

    • शायद prompt wording की वजह से, लेकिन Codex के रूप में इस्तेमाल किए गए OpenAI models ने binary reverse engineering से कभी इनकार नहीं किया। अभी भी Codex से third-party firmware का analysis कर रहा हूँ और अब तक एक बार भी restriction नहीं लगी
      दूसरी ओर, कुछ लोग कहते हैं कि security से असंबंधित prompts भी reject हो जाते हैं, इसलिए सोचता हूँ कि platform और user के हिसाब से इतना फ़र्क़ कैसे हो सकता है
    • DeepSeek V4 Flash ज़्यादातर कामों के लिए काफ़ी है और response भी तेज़ देता है। tokens मैं ज़्यादातर अमेरिका की FireWorks.ai से खरीदता हूँ, लेकिन DeepSeek में भी bulk prepayment कर रखी है
      Claude Code की तुलना में कम tokens इस्तेमाल करने वाले OpenCode का ज़्यादा उपयोग करता हूँ, और DeepSeek का अपना coding harness आने का भी इंतज़ार है
    • कुल मिलाकर अच्छा है, लेकिन OpenRouter में output token limit ज़रूरत से ज़्यादा कड़ी है। अगर reasoning किसी जाल में फँस जाए तो मॉडल limit के भीतर खुद उससे बाहर नहीं निकल पाता, फिर भी इसने Kimi model की जगह ले ली है
  • निजी रोज़मर्रा के agent कामों के लिए DeepSeek इस्तेमाल करने के पिछले 30 दिनों का रिकॉर्ड है: लागत 4.55 डॉलर, API requests 3,467, tokens 323,183,886
    एक छोटे team को lead करने वाले engineer के रूप में मेरे quality standards ऊँचे हैं, और निजी projects पर भी वही standards लागू करता हूँ, लेकिन coding और review tasks में मुझे बिल्कुल निराशा नहीं हुई। बाकी कामों के लिए दूसरे models इस्तेमाल करता हूँ

    • LLM से code review करते समय आप कौन-सा तरीका और कौन-से prompts इस्तेमाल करते हैं, यह जानना चाहता हूँ। जवाबों की quality काफ़ी कम लगी, इसलिए समझना चाहता हूँ कि वजह मेरा उपयोग तरीका तो नहीं
    • इतनी token caching हासिल करने के लिए आप कौन-सा harness इस्तेमाल करते हैं, यह जानना चाहता हूँ
    • hallucination ज़्यादा होती है या नहीं, और अगर होती है तो workflow पर उसका क्या असर पड़ता है, यह जानना चाहता हूँ
    • quality असाधारण नहीं है, और ज़्यादातर LLMs के साथ भी यही बात लागू होती है
  • अब pi के अंदर लगभग हर काम Flash से चलाता हूँ। सही MCP server, context reduction tools और skills हों तो कोई भी काम implement किया जा सकता है
    कुछ sessions 30 turns से ज़्यादा लेते हैं, लेकिन यह तेज़ और सस्ता है, इसलिए एक घंटे तक काम करने पर भी लगभग 0.5 डॉलर काफ़ी होते हैं। हालांकि multi-subagent workflows में planning·review·oracle roles के लिए महंगे models भी इस्तेमाल करता हूँ
    धीमी Opus subscription को कई हफ़्तों से इस्तेमाल नहीं किया। फ़ोन पर भी चलने वाला, MCP और skills support करने वाला self-hosted OpenWebUI chat भी बना लिया है, जिसने Perplexity को पूरी तरह replace कर दिया है, और hosting व subscription cost मिलाकर लगभग 18 डॉलर प्रति माह है

    • मैं भी pi + DeepSeek संयोजन में todo tracking और token बचत के लिए कई custom tools जोड़कर, सिर्फ़ बहुत कठिन कामों में cutting-edge models इस्तेमाल करता हूँ। यह setup मेरी ज़रूरत की सारी सुविधाएँ पूरी करता है
    • pi के लिए काम की extensions की सिफारिशें चाहिए
    • इस update में महसूस होने वाले सुधार हैं या नहीं, यह जानना चाहता हूँ
    • pi में top_p और temperature कैसे सेट करें, यह जानना चाहता हूँ
  • अगर benchmark वास्तव में real-world performance को ठीक से दर्शाता है, तो यह चौंकाने वाला मॉडल है। 300B मॉडल पिछले DS4 Pro preview model के 1.8T parameters वाले performance को पार करता है और GPT 5.6 Luna से भी बेहतर दिखता है
    price cut के बाद वाली Luna से भी यह अब भी सस्ता है

    • DeepSWE में DeepSeek 54.4% है, Luna 67%
  • 200B मॉडल का GLM-5.2 से टक्कर लेना और Opus 4.8 के करीब पहुँचना काफ़ी प्रभावशाली है
    अगर ये आँकड़े general performance में भी दिखाई दें और DeepSeek की शानदार caching भी जुड़ जाए, तो इसका उपयोग बहुत बढ़ सकता है

    • यह सिर्फ़ 200B model ही नहीं, इसका size भी केवल 160GiB है
  • सोचता हूँ कि इसे और स्पष्ट रूप से अलग दिखाने के लिए v4.1-Flash क्यों नहीं कहा गया

  • अगर यह speed और कम कीमत बनाए रखते हुए पहले से ही काफ़ी उपयोगी deepseek-v4-pro की performance को भी पार कर जाए, तो यह बहुत आशाजनक है
    deepseek-v4-flash पहले से ही price-to-performance के हिसाब से सबसे अच्छा मॉडल था, इसलिए intelligence/cost metric में अंतर और बढ़ सकता है। हालाँकि DeepSeek API की सस्ती लागत का एक मतलब यह भी है कि codebase की जानकारी चीन तक जाती है

    • कम से कम एक benchmark में इसे GLM 5.2 से बेहतर बताया गया है
  • महंगे कामों के लिए Opus की जगह Kimi K3, और सामान्य कामों के लिए Sonnet की जगह DSV4 Flash इस्तेमाल करना क्या उचित setup है?

    • लगता है deepseek-v4-pro का updated version जल्द आएगा, और DSV4 Flash में बड़े सुधार को देखते हुए यह intelligence और cost दोनों में Kimi K3 से आगे निकल सकता है
    • काफ़ी उचित है। DSV4 Flash से coding या server checking का एक घंटा करने पर भी शुद्ध API लागत लगभग 0.30 डॉलर ही आती है, जो हर बार चौंकाती है
    • बैकग्राउंड में इन दोनों models के बीच switch कराने के लिए मेरा model router इस्तेमाल किया जा सकता है
  • coding के अलावा दूसरे उपयोग वाले agents में DSv4 के इस्तेमाल के उदाहरण जानना चाहता हूँ। खासकर वे लोग जो GPT-5.4 mini से classification या categorization आदि कर रहे थे, वे DSv4 को कैसे इस्तेमाल कर रहे हैं, यह जानना चाहता हूँ