- Poolside ने Laguna S 2.1 जारी किया है, जो long-horizon tasks और reasoning क्षमता को मजबूत करता है। यह कुल 118B MoE में से प्रति token 8B parameters सक्रिय करता है, और thinking तथा no-thinking दोनों modes में अधिकतम 1M token context को support करता है
- training शुरू होने से release तक 9 सप्ताह से कम समय लगा, और इसने Terminal-Bench 2.1 में 70.2%, SWE-Bench Multilingual में 78.5%, तथा DeepSWE v1.1 में 40.4% दर्ज करके बड़े models से प्रतिस्पर्धा की
- प्रदर्शन सुधार का केंद्र सिर्फ model scaling नहीं, बल्कि persistence·verification·rollback के बाद retry है। लंबे rollouts, बेहतर sandbox, और कई agent harnesses का उपयोग करके जल्दबाज़ी में completion घोषित करने और single-harness overfitting को कम करने की कोशिश की गई
- वास्तविक कार्यों में इसने 181 steps में HTML/CSS rendering engine बनाया, अपने harness की गति 5.2% बढ़ाई और memory allocation लगभग 70% घटाई, तथा Erdős problem #397 के infinite solution set को स्वतंत्र रूप से फिर से खोजा
- model और final evaluation की पूरी execution trajectories सार्वजनिक की गई हैं, लेकिन third-party harness के tool specs, nested tool calls के JSON, और अत्यधिक लंबे reasoning पर कुछ सीमाएँ हैं। Hugging Face और प्रमुख inference frameworks·hosting services पर weights और अधिकतम 1M context उपलब्ध हैं
मॉडल आर्किटेक्चर और रिलीज़ की गति
- Laguna S 2.1 एक Mixture-of-Experts model है, जिसमें कुल 118B parameters और प्रति token 8B active parameters हैं
- thinking और no-thinking दोनों modes में अधिकतम 1M token context support करता है
- training शुरू होने से release तक 9 सप्ताह से कम समय लगा
- 22 मई 2026 को 4,096 NVIDIA H200 GPU पर pretraining शुरू की गई और 60 दिन बाद इसे सार्वजनिक किया गया
- छोटे active size की वजह से जटिल tasks को local systems पर चलाया जा सकता है, और यह एकल NVIDIA DGX Spark पर भी चल सकता है
long-horizon coding benchmarks में प्रदर्शन
- 21 जुलाई 2026 तक के प्रमुख परिणाम इस प्रकार हैं
- Terminal-Bench 2.1: 70.2%
- SWE-Bench Multilingual: 78.5%
- SWE-Bench Pro public dataset: 59.4%
- DeepSWE v1.1: 40.4%
- SWE Atlas(Codebase QnA): 46.2%
- Toolathlon Verified: 49.7%
- Terminal-Bench 2.1 उन विविध long-horizon tasks का मूल्यांकन करता है जिनमें agent terminal के माध्यम से environment के साथ interact करता है, और Laguna S 2.1 ने thinking enabled pool harness पर 70.2% दर्ज किया
- परिपक्व benchmarks में शीर्ष scores अक्सर 70~90% के बीच सिमट जाते हैं, इसलिए व्यवहार में बड़ा अंतर रखने वाले models भी कुछ अंकों के अंतर से दिख सकते हैं
- DeepSWE में partial solution कठिन है और इसमें अधिक लंबे tasks शामिल हैं, इसलिए score variance बड़ा है
- v1.1 में frontier models ने 54~73% दर्ज किया, जबकि कुछ 1T+ public models 10% से कम पर रहे
- Laguna S 2.1 ने अपने pool harness पर 40.4% दर्ज किया
- आधिकारिक leaderboard के mini-swe-agent की जगह अपने harness का उपयोग किया गया, इसलिए अन्य model scores के साथ यह पूरी तरह समान तुलना नहीं है
- अन्य models के लिए self-reported results, benchmark leaderboard, और Artificial Analysis में से अधिकतम score का उपयोग किया गया
- final evaluation की सभी execution trajectories trajectories.poolside.ai पर सार्वजनिक हैं
evaluation method और reward hacking प्रबंधन
- agent evaluation में online सही उत्तर या पुराने fixes खोजकर score पाने की reward hacking समस्या मौजूद है
- internet access को default रूप से अनुमति दी गई और human-labeled trajectories से calibrate किए गए LLM judge(LLMaaJ) का उपयोग संदिग्ध मामलों को चिह्नित करने के लिए किया गया
- शुरुआती post-training में reward hacking rate 2% से कम थी
- training आगे बढ़ने पर SWE-bench family में flagged trajectories 50% से ऊपर चली गईं
- manual investigation में कई मामलों में model ने उस PR या repository को ढूंढ लिया जो समस्या का आधार था, और वास्तव में वही fix लागू किया
- user prompt में online मिले direct answers का उपयोग न करने वाला वाक्य जोड़ने के बाद reward hacking rate सामान्यतः 2% से नीचे आ गई
- यह पूर्ण समाधान नहीं है, और ProgramBench तथा MirrorCode में अपवाद थे
- अतिरिक्त verification के लिए LLMaaJ द्वारा flagged successful cases की manual investigation, पूरी trajectories का open-ended agent analysis, और Terminal-Bench 2.1 के high-scoring runs की expert review का उपयोग किया गया
- हाल में adversarial review के जरिए reward hacking detection को मजबूत किया गया, और public checkpoints की final evaluation trajectories को देखा व डाउनलोड किया जा सकता है
वास्तविक कार्यों के उदाहरण
-
खाली फ़ोल्डर से browser engine बनाना
- Laguna S 2.1 ने बिना मानव हस्तक्षेप के 50 मिनट तक 181 steps चलाकर खाली folder से HTML/CSS rendering engine बनाया
- visual capability न होने की स्थिति में इसने headless Chromium के जरिए canvas पढ़ा और screenshots को संख्यात्मक रूप से compare करके परिणाम verify किए
- पूरी pipeline को Vanilla JavaScript में implement किया गया
- HTML tokenizer और DOM tree
- selector priority संभालने वाला CSS parser
- inheritance support वाला cascade engine
- box model layout और Canvas 2D renderer
- अंत में इसे एक app के रूप में पूरा किया गया, जो अपने canvas और browser iframe में एक ही markup के 9 examples को साथ-साथ दिखाता है
- पूरी execution trajectory सार्वजनिक है
-
अपने agent harness का optimization
- benchmark-instrumented automated research loop में हर बदलाव के बाद performance मापी गई और केवल verified improvements को बनाए रखने की शर्त लगाई गई
- कई घंटों में harness को 5.2% तेज़ किया गया और memory allocation लगभग 70% कम की गई
- मुख्य optimizations इस प्रकार थे
- streaming token accumulation में उपयोग हो रही O(n²) string concatenation को buffer से बदला गया
- trajectory concretization process में duplicate copies को memoization से हटाया गया
- slices को सही size में preallocate करके overallocation घटाया गया
- speed difference को मापना कठिन होने के बाद ध्यान memory allocation optimization पर शिफ्ट किया गया, जिसे अधिक सटीकता से मापा जा सकता था
- उपयोग किया गया benchmark पूरी production test नहीं था, लेकिन final result को Go race detector और
go vetgate से verify किया गया और artifact के व्यवहार की पुष्टि की गई - पूरी execution trajectory उपलब्ध है
-
Erdős problem #397 की पुनर्खोज
- 1975 में Erdős, Graham, Ruzsa, Straus द्वारा प्रस्तावित Erdős problem #397 में infinite solution set बनाने वाली construction को स्वतंत्र रूप से खोजा गया
- यह समस्या 50 साल से अधिक समय तक unsolved रही, लेकिन जनवरी 2026 में GPT-5.2 Pro ने पहले इसे हल किया, इसलिए यह पहली खोज नहीं बल्कि पुनर्खोज है
- model की knowledge cutoff नवंबर 2025 है, और sandbox में Python न मिलने पर इसने Perl ढूंढकर 68 मिनट तक काम किया
- समाधान प्रक्रिया इस प्रकार थी
- exact factorization के लिए brute-force search किया गया
- patterns का analysis करके solution family का अनुमान लगाया गया
- 8 indices वाले closed-form infinite solution set को prove किया गया
- खोजा गया expression सभी
n ≥ 0के लिए इस प्रकार है
B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n) = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)- पहले से मौजूद 6-index solution family के विपरीत, इसमें linear growth वाली 8-index structure का उपयोग किया गया
- पूरी execution trajectory सार्वजनिक है
reasoning mode और प्रदर्शन का अंतर
- reasoning mode दो हैं: off और default max
- max में model प्रत्येक समस्या के लिए reasoning और test-time compute budget स्वयं तय करता है
- कई मामलों में घंटों और सैकड़ों हजार tokens तक लगातार reasoning जारी रखने के उदाहरण देखे गए
- max thinking का उपयोग करने पर प्रदर्शन काफी बढ़ता है
- Terminal-Bench 2.1: 60.4% → 70.2%
- DeepSWE: 16.5% → 40.4%
- release के समय low·medium·high जैसे user-defined reasoning intensity controls उपलब्ध नहीं हैं
poolमें session-based/thought-levelcommand से thinking को on/off किया जा सकता है
ज्ञात सीमाएँ
- harness overfitting की वजह से Hermes Agent के terminal tool जैसे, अपने harness से मिलते-जुलते लेकिन अलग details वाले tools को पहली बार call करते समय model पुराने interface memory पर निर्भर कर सकता है
- यदि harness गलत call को reject कर retry माँगे, तो in-context learning से यह अधिकांशतः सुधर जाता है
- यह XML-जैसे tag-based tool call format का उपयोग करता है, और जब arguments में JSON array चाहिए हो तो गलत escaping या invalid JSON बना सकता है
- खासकर competition math problems में बिना प्रगति के बहुत लंबे समय तक reasoning कर सकता है
- अगली models में reasoning intensity control और reasoning efficiency improvements लाने की योजना है
प्रदर्शन सुधार लाने वाले training changes
-
model size से अधिक work style में सुधार
- लक्ष्य सिर्फ अधिक intelligence जोड़ना नहीं, बल्कि ज़्यादा verify करना, बातों को स्वतःसिद्ध न मानना, और जल्दी success declare न करना जैसे व्यवहार को मजबूत करना है
- पिछली Laguna models कभी-कभी कुछ tests pass होते ही completion घोषित कर देती थीं या सफलता से ठीक पहले approach छोड़ देती थीं, लेकिन S 2.1 लगातार काम जारी रखता है
- raw intelligence से अलग persistence, verification, और वापस लौटकर दोबारा कोशिश करने की इच्छा को महत्वपूर्ण performance axis माना गया है, और दोनों दिशाओं में निवेश किया गया है
- अगला बड़ा Laguna model पहले ही pretraining शुरू कर चुका है
-
pretraining और post-training
- यह Laguna XS 2.1 के उसी pretraining data का उपयोग करने वाला scaled-up model है
- XS 2.1 से अंतर scale, training code modifications, और छोटे training recipe changes का है, नया data नहीं
- पहली बार RL को FP8 precision पर चलाया गया, जिससे उस training stage को तेज़ किया गया
- post-training दो चरणों में हुई
- कुछ synthetic data का उपयोग करने वाली supervised fine-tuning(SFT) से capabilities initialize की गईं
- जिन tasks को अभी भी उच्च pass rate से हल नहीं किया जा रहा था, उन पर RL लागू किया गया
- लंबे agent sessions में सैकड़ों हजार tokens का task context जमा हो जाता है, इसलिए 1M context extension कठिन tasks में प्रदर्शन बढ़ाता है
-
post-training task composition
- training corpus में agent और non-agent environments के 409,000 उदाहरण शामिल हैं
- terminal-use environments 83,000
- general software engineering tasks 168,000
- tasks open source repositories, internal synthetic data, automated dependency installation system, और external data provider acquisitions से जुटाए गए
- software engineering tasks मुख्यतः वास्तविक code history पर आधारित हैं
- लगभग 17,000 repositories के वास्तविक commits को reproduce करने वाले लगभग 38,000 tasks सबसे बड़ा हिस्सा बनाते हैं
- merged PR reproduction, injected bug fixing, और test suite के आधार पर deleted files restore करने वाले tasks भी शामिल हैं
- S 2.1 में repository की सभी dependencies install करके test suite चलाने वाला agent repository install task जोड़ा गया
- terminal tasks के लिए ऐसा dataset इस्तेमाल किया गया जो seeds में न देखे गए environments और assignments उत्पन्न करता है
- training corpus में agent और non-agent environments के 409,000 उदाहरण शामिल हैं
-
training loop में सुधार
- पिछली models की तुलना में time limit, per-turn tokens, और per-task turns बढ़ाने वाला बड़ा rollout budget लागू किया गया
- RL को नए sandbox service पर migrate किया गया, जिससे निम्न सुविधाओं का उपयोग हुआ
- background processes support
- optional network blocking के जरिए reward hacking surface में कमी
- artifact caching के जरिए external services पर overload रोकना
- एक ही prompt को कई agent harnesses पर चलाकर model को केवल एक scaffold नहीं बल्कि विविध harnesses में काम आने वाला व्यवहार सिखाया गया
Poolside के फोकस की दो दिशाएँ
- पहली दिशा agent coding capability है
- कंपनी coding और software के flexible interface को intelligence तक पहुँचने का रास्ता मानती है
- फोकस उन मामलों पर है जहाँ model agent के रूप में software का उपयोग करते हुए घंटों या दिनों तक लगातार काम करता है
- दूसरी दिशा यह विचार है कि web पर दर्ज उत्तरों से उस उत्तर तक पहुँचने की thought process को reinforcement learning से reconstruct किया जा सकता है
- यह release पहली दिशा का परिणाम है, जबकि दूसरी दिशा पर काम जारी है
Model Factory और development cycle
- internal research·engineering platform Model Factory के जरिए data, architecture ablation experiments, evaluation infrastructure आदि model development process को automate किया गया
- Laguna M.1 के release के 3 महीने से कम समय में आधे runtime size और अधिक मजबूत प्रदर्शन वाला model विकसित किया गया
- research iteration और integration speed बढ़ाने, तथा researchers का bookkeeping और infrastructure पर जाने वाला ध्यान घटाने में निवेश किया जा रहा है
- अगले 1 वर्ष में यही development approach बड़े models पर लागू करने की योजना है
deployment और उपयोग के तरीके
- Hugging Face पर OpenMDW-1.1 license के तहत जारी किया गया
- BF16, FP8, INT4, NVFP4 weights उपलब्ध हैं
- official GGUF·MLX conversions और DFlash draft model उपलब्ध हैं
- NVIDIA hardware पर TRT-LLM serving, Blackwell के NVFP4, और single DGX Spark तक inference optimization support है
- local और public serving के लिए vLLM, SGLang, Ollama support करते हैं
- hosted access paths इस प्रकार हैं
- Baseten Model Library और Frontier Gateway
- OpenRouter
- Vercel AI Gateway
- OpenRouter free endpoint 256K context देता है
- dedicated paid endpoint 1M context support करता है
- प्रति 10 लाख tokens input $0.10, output $0.20, cache read $0.01 है
- इसे Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline, और terminal coding agent pool में भी उपयोग किया जा सकता है
- post-training को NVIDIA NeMo AutoModel और Prime Intellect Prime Lab support करते हैं, जबकि ZML LLMD कई hardware पर execution support देता है
- non-developer users बिना login के chat.poolside.ai पर web search और basic code execution features का उपयोग कर सकते हैं
- post-training से पहले के base model weights email request पर उपलब्ध हैं
benchmark execution conditions
- internal Harbor Framework fork, pool agent harness, अधिकतम 500 steps, और internal sandbox का उपयोग किया गया
- SWE-bench Multilingual, SWE-Bench Pro, और Terminal-Bench 2.1 में प्रति task 4 runs के average pass@1 का उपयोग किया गया
- DeepSWE v1.1 और SWE Atlas में प्रति task 3 runs, और Toolathlon Verified में 3-run average लागू किया गया
- SWE Atlas में public methodology को ज्यों का त्यों लागू किया गया और Opus 4.5 से judgment किया गया
- Toolathlon Verified में EC2 के replicated harness और custom agent का उपयोग किया गया, और official version के विपरीत हर evaluation run के बाद environment को पूरी तरह reset और restore किया गया
- sandbox preemption रोकने के लिए CPU·memory·storage limits को benchmark के अनुसार adjust किया गया, और कम-से-कम 2 CPU cores, 8GB memory, और 25GB storage सुनिश्चित की गई
- individual task fixes technical report में संकलित हैं
1 टिप्पणियां
Hacker News की राय
memfd_create()/mmapका इस्तेमाल IPC के लिए हुआ था, और Sol ने भी उसे तब तक मिस किया जब तक मैंने खुद इशारा नहीं कियाDeepSeek V4 से तुलना अभी के इस तेज़ी से बदलते माहौल में तुरंत बदल सकती है, क्योंकि Flash और Pro दोनों जल्द ही पर्याप्त आगे की ट्रेनिंग के बाद औपचारिक रूप से रिलीज़ होने वाले हैं। उम्मीद है ऐसे मॉडल आते रहेंगे
https://github.com/mozilla-ai/otari/pull/348
Qwen 3.5 122B के 2-bit वर्ज़न को भी ठीक-ठाक बताया गया था, और इस मॉडल की शुरुआती क्षमता उससे बेहतर है, इसलिए इसे आज़माना बनता है। कोई इस पर पहले से काम कर रहा है: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/tree/main
Q4_K_Mभी 75GB है, इसलिए 64GB environment में भी शायद इसे और नीचे quantize नहीं किया जाएगा। इसकी बजाय weights का सिर्फ एक हिस्सा memory में resident रखकर बाकी को SSD से stream करना बेहतर होगाllm-compressorइस्तेमाल करता हूँ, वह ऐसे models को भी quantize कर सकता है जो memory में फिट नहीं होते; बस sequential pipeline का इस्तेमाल करना होता हैhttps://github.com/vllm-project/llm-compressor
config examples https://github.com/verdverm/quantr में हैं। हालांकि Poolside ने अब मॉडल के साथ quantized builds और dflash भी जारी कर दिए हैं, इसलिए शायद इसकी ज़रूरत न पड़े
अब तक Strix Halo पर Gemma 4 या Qwen 3.6 dense models को dual 32GB GPU desktop पर चलाने की तुलना में कोई साफ़ तौर पर बेहतर विकल्प नहीं था, लेकिन यह मॉडल इतना बड़ा लगता है कि वास्तविक performance improvement दे सकता है
vLLM रन सेटिंग में
--default-chat-template-kwargs '{"enable_thinking": true}'डालने पर भी यह enable नहीं हुआ, और शामिलgeneration_config.jsonमेंmax_new_tokensका डिफ़ॉल्ट 32k होने के कारण लगता है reasoning कट रही है, इसलिए इसे बढ़ाना होगा। reasoning ऑन करने के बाद code quality काफ़ी बेहतर हो गई, हालांकि वास्तविक काम में अतिरिक्त verification अभी भी ज़रूरी हैhttps://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
यह अच्छा लगता है कि Poolside सिर्फ समान आकार के मॉडलों से नहीं, बल्कि 2.5T Kimi-K3 जैसे कहीं बड़े शीर्ष open-weights models से भी तुलना कर रहा है। काश Mistral और दूसरे भी ऐसा करें
poolऔर 33B MoE model देखते हुए पहली बार Poolside के बारे में पता चला। यह पुराने 32GB Mac mini पर भी तेज़ और प्रभावी था, और मैं इसके बड़े hosted models को भी परखने की सोच रहा हूँ