- ई-कॉमर्स catalog moderation के लिए 9B open-source model को लगभग 500 डॉलर में reinforcement learning से fine-tune करने पर, उसी tools·images·grader का उपयोग करने वाले सभी frontier model configurations से अधिक score मिला
- 1,77,767 moderation episodes से बने digital twin में product classification, brand verification, attribute extraction, policy judgment को बार-बार चलाकर कंपनी की अपनी taxonomy और decision criteria को model weights में सिखाया गया
- GRPO-trained model ने achievable maximum score का 87.3% हासिल किया, जो शीर्ष frontier configuration के 76.9% से सापेक्ष रूप से 13.5% अधिक था, और बिना training वाले base model के 64.2% से 36% बेहतर था
- लागत प्रति 1,000 products लगभग 0.50 डॉलर रही, जो सबसे सस्ते frontier configuration से 40 गुना और सबसे महंगे configuration से लगभग 340 गुना सस्ती है; रोज़ 4 करोड़ items के scale पर यह सालाना लगभग 70 लाख डॉलर बनाम 50 करोड़ डॉलर का अंतर पैदा करती है
- यह नतीजों को rules·tests·rubric से verify किए जा सकने वाले बड़े पैमाने के दोहरावदार कामों के लिए उपयुक्त है, और बदलते facts को retrieval tools में रखते हुए कंपनी के अपने निर्णय लेने के तरीके को model में सिखाने वाली संरचना की जरूरत होती है
AI निवेश के नतीजे तय करने वाला संचालन मॉडल
- ChatGPT के launch के बाद AI का उपयोग document summary और email draft जैसे low-risk कामों से बढ़कर software development, content generation, और internal knowledge·data·tools को जोड़ने वाले company brain की परिकल्पना तक पहुंच गया है
- Ramp customer data में AI spending के top 25% वाले enterprises ने नवंबर 2022 से दिसंबर 2025 तक revenue को 2x से अधिक बढ़ाया, जबकि AI spending न करने वाली कंपनियां उसी अवधि में लगभग 15% बढ़ीं
- अच्छा प्रदर्शन करने वाले संगठनों में बार-बार ये operating patterns दिखते हैं
- Workflow redesign: मौजूदा process में सिर्फ model जोड़ना काफी नहीं; approvals, reviews, handoffs और human intervention points को फिर से design करना पड़ता है
- McKinsey के 2025 generative AI adoption survey में workflow redesign का EBIT impact से सबसे ऊंचा correlation दिखा, लेकिन वास्तव में कम-से-कम एक workflow redesign करने वाले organizations सिर्फ 21% थे
- Experiment को बढ़ावा: models, tools और best practices बहुत तेज़ी से बदलते हैं, इसलिए सिर्फ successful launches ही नहीं बल्कि experiments और failures की sharing पर भी reward होना चाहिए
- Custom work context: data access, per-request access control, relevant evidence retrieval, और लंबे होते context window के साथ uneven usage management अलग engineering challenge बन जाता है
- Usage और impact measurement: अपने data पर grading evaluation के बिना performance, decision cost और efficiency impact साबित करना मुश्किल होता है, और self-reported time-saving numbers भी गलत हो सकते हैं
- Workflow redesign: मौजूदा process में सिर्फ model जोड़ना काफी नहीं; approvals, reviews, handoffs और human intervention points को फिर से design करना पड़ता है
‘Intelligence ownership’ के लिए deployment model
- बार-बार सामने आने वाला configuration है open-source model, कंपनी का अपना work data, और gradable workflows का इस्तेमाल करने वाला reinforcement learning
- frontier models का उपयोग automation की संभावना verify करने और शुरुआती baseline बनाने के लिए किया जाता है
- calls के दौरान inputs, decisions और corrections के records जमा होते हैं, जो बाद में specialized model के training data बनते हैं
- prototype से आगे बढ़कर large-scale operations phase में पहुंचने पर per-call cost और performance प्राथमिकता बन जाते हैं
- frontier models और specialized models पूरी तरह एक-दूसरे के alternatives नहीं हैं
- ChatGPT या Claude जैसे general-purpose models, internal knowledge की जरूरत वाले हिस्सों को specialized models को सौंप सकते हैं
- specialized models भी जहां high general capability चाहिए, वहां frontier models को call कर सकते हैं
- models कंपनी के tools और data के साथ काम करते हैं, rubric output को grade करता है, और reward signal model को update करता है
- जब यही process दसियों हजार tasks पर दोहरती है, तो business judgment weights में बस जाता है
- price, inventory, policy documents जैसे बदलते facts tools में ही रखे जाते हैं
specialized models के वास्तविक deployment examples
- Bridgewater Associates ने articles, disclosures और emails निवेश thesis से संबंधित हैं या नहीं, और boilerplate language कहां से शुरू होती है, इसका निर्णय कराने के लिए specialist investors के labels से open-source model को train किया
- सिर्फ prompts से internal judgment criteria को स्थिर रूप से reflect नहीं कराया जा सका
- trained model में शीर्ष frontier model की तुलना में लगभग 30% कम errors थे और inference cost भी कम थी
- Harvey ने deal diligence और legal memo drafting जैसे multi-step tasks पर open-weight model और reinforcement learning लागू किया, जहां कई चरणों में errors जमा होते हैं
- अपने rubric में legal agent ने GPT-5.5 और Claude Opus 4.8 को पीछे छोड़ा
- Intercom Fin Apex को प्रति सप्ताह लगभग 20 लाख customer issues संभालने वाले scale पर per-call cost और resolution rate सुधारने के लिए अरबों customer service interactions से post-trained किया गया
- Intercom के अनुसार यह शीर्ष frontier models से अधिक issues resolve करता है और operating cost भी कम है
- सामान्य deployment pattern यह है कि prompt और context-optimized frontier model से baseline बनाई जाए, फिर execution logs और learned behavior को ऐसे छोटे model में transfer किया जाए जिसका मालिक enterprise खुद हो
catalog integrity और लागत की समस्या
- ई-कॉमर्स catalog में हर product को सही taxonomy में रखना होता है, और search·filter·recommendation·downstream operations में उपयोग होने वाले attributes को image और description से सही तरह extract करना होता है
- गलत judgment product discoverability और recommendation quality को खराब करती है, और policy violations छूट सकते हैं
- counterfeit products छूट जाएं तो customers और brands धोखाधड़ी के संपर्क में आ जाते हैं
- legitimate products को जरूरत से ज्यादा flag किया जाए तो review queue और seller friction बढ़ती है
- काम का scale भी बहुत बड़ा है
- eBay पर लगभग 2.5 अरब active products हैं
- Shopify catalog में रोज़ 1 करोड़ से अधिक product updates आते हैं
- Walmart का अनुमान है कि AI-assisted catalog work को सिर्फ humans से करना पड़ता तो लगभग 100 गुना अधिक workforce चाहिए होती
- 71% consumers ने कहा कि उन्होंने actual product listing से अलग होने के कारण return किया है
- अगर कोई mid-sized marketplace रोज़ लगभग 1 करोड़ product creations·edits process करे, तो frontier model-based moderation की सालाना लागत लगभग 50 करोड़ डॉलर और fine-tuned specialized model की लगभग 1 करोड़ डॉलर आंकी गई है
- Shopify commercial APIs के साथ आर्थिक रूप से यह संभव न होने के कारण fine-tuned open models का उपयोग करके रोज़ लगभग 4 करोड़ product classification inferences चलाता है
catalog moderation agent का काम
- agent product की review करते समय taxonomy search करता है, brand verify करता है, संबंधित category का attribute schema लाता है, और फिर structured decision finalize करता है
- evidence कम हो या risk ज़्यादा हो तो मामला human review में भेज दिया जाता है
- work gloves का case इस क्रम में process होता है
search_taxonomyसेSafety Work Glovescategory खोजी जाती हैlookup_brandसे verify किया जाता है कि AmazonBasics registered है, लेकिन protected नहीं हैget_attribute_schemaसे brand, color, material, size attributes निकाले जाते हैं- category·attributes के साथ
alloweddecision finalize किया जाता है
- वास्तविक violations छूटने की लागत को false positives से 7 गुना अधिक रखा गया, ताकि दोनों error types को asymmetrically train किया जा सके
training के लिए digital twin
- Amazon Berkeley Objects की वास्तविक product images और listings का उपयोग करके 1,77,767 moderation episodes बनाए गए
- हर episode में image, title, description, claimed brand और region शामिल हैं
- controlled policy violations, mismatched images, conflicting brand claims, और legitimate claims को hard negative examples के रूप में डाला गया
- हर episode में gradable ground truth मौजूद है
- model जिस environment का उपयोग करता है, वह वास्तविक analyst workflow को reproduce करता है
- लगभग 13,000 categories search की जाती हैं
- brands की registration·protection status verify की जाती है
- चुनी गई category के लिए जरूरी attributes लाए जाते हैं
- final category, attributes और policy decision finalize किए जाते हैं
- grader सही answers पर reward देता है और missed violations, unsupported attributes, wrong classification, और unnecessary tool calls पर penalty लगाता है
- Reinforcement learning के लिए ऐसा environment चाहिए जहां वास्तविक workload list, tools और decision costs को reproduce करते हुए failures और retries बार-बार हो सकें
frontier model baseline
- GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8, Claude Fable 5 की तुलना 200 stratified validation episodes पर की गई
- सभी models पर समान tools, images, grader और turn budget लागू किया गया
- default prompt और 2,800-character optimized prompt—जिसमें extraction rules, lookup procedures और examples थे—दोनों का परीक्षण किया गया
- शीर्ष frontier configuration ने achievable score का 76.9% हासिल किया, जबकि GRPO-trained 9B model ने 87.3% हासिल किया
- frontier models को हर episode में उस shop की taxonomy, inventory conventions, supported attribute values और exception handling rules को prompt में फिर से reconstruct करना पड़ता है
- optimized instructions से कुछ knowledge compress की जा सकती थी, लेकिन score तय करने वाले सभी exceptions को enumerate करना संभव नहीं था
- optimized frontier configurations एक-दूसरे से 0.1 percentage point के भीतर converge हो गए
- zero-shot extraction में सबसे अच्छा Gemini, optimized instructions के बाद उल्टा कमजोर हो गया
- extra instructions ने model के अनुसार हर call पर input token cost को 28–55% तक बढ़ा दिया
- prompt में डाला गया task knowledge हर call पर cost पैदा करता है, जबकि learned knowledge weights में बनी रहती है
500 डॉलर का GRPO training
- training के लिए RTX PRO 6000 GPU की 2 rental units ली गईं; एक rollout generation के लिए और दूसरी gradient updates के लिए इस्तेमाल हुई
- infrastructure open-source prime-rl पर बनाया गया
- पूरी training में 1,000 optimization steps, लगभग 3.5 दिन, और लगभग 500 डॉलर का GPU cost लगा
- लगभग 250 steps और करीब 1 दिन की training में ही यह frontier model range को पार कर गया
- बाकी steps peak performance निकालने के लिए इस्तेमाल हुए
- अंतिम strict benchmark score 0.626 रहा, जो achievable ceiling का 87.3% है और शीर्ष frontier configuration से लगभग 10 percentage points अधिक है
- W&B training monitor में score लगभग 0.50 से बढ़कर 1,000 steps पर 0.671 तक गया
- monitor ने प्रति episode 2 sampled rollouts का उपयोग किया, इसलिए उसका score strict benchmark harness से थोड़ा ऊंचा है
- बिना training वाला 9B base model maximum score का 64.2% था, जो fine-tuning के बाद 87.3% तक गया—यानी सापेक्ष रूप से लगभग 36% improvement
- specialized model taxonomy, tools, policies और rewards के संबंध सीखकर अपनी क्षमता को खास environment behavior पर केंद्रित करता है, बदले में general capability कुछ कम हो सकती है
- अगर और मजबूत open-source base model आएं, तो यही training method उन पर transfer की जा सकती है; operation के दौरान recorded decisions को supervised fine-tuning data में distill करके बाद की retraining में भी उपयोग किया जा सकता है
लागत और quality की तुलना
- specialized model की inference cost प्रति 1,000 products लगभग 0.50 डॉलर है, और fine-tuning से इसी cost पर base 9B model की तुलना में लगभग 23 percentage points अधिक score मिला
- तुलना के लिए cost difference इस प्रकार है
- सबसे सस्ता frontier configuration Gemini, 1,000 products पर 19 डॉलर पड़ता है, यानी specialized model से 40 गुना महंगा
- सबसे महंगा GPT-5.5-pro, 1,000 products पर 172 डॉलर पड़ता है, यानी लगभग 340 गुना महंगा
- सबसे ऊंचा frontier score देने वाला configuration 1,000 products पर 34 डॉलर का है, यानी specialized model से 68 गुना महंगा
- 2,800-character instructions ने GPT-5.5 की measured cost को लगभग एक-तिहाई बढ़ा दिया, और यह prompt tax बाद की हर call पर दोहराया जाता है
- रोज़ लगभग 4 करोड़ items process करने पर 1,000 items पर 34 डॉलर वाला configuration सालाना लगभग 50 करोड़ डॉलर खर्च करता है, जबकि 0.50 डॉलर वाला specialized model लगभग 70 लाख डॉलर—यानी करीब 98% cost difference
किन कामों में उपयुक्त, किन क्षेत्रों में नहीं
- उपयुक्त tasks वे हैं जहां जानकारी से decision बनता है और काम बड़े पैमाने पर दोहरावदार है
- ticket routing
- document field extraction
- policy-based submission inspection
- product classification
- transaction approval या flagging
- मुख्य शर्त यह है कि क्या हर decision की सही-गलत को rules, schema, tests, rubric या expert judgment से verify किया जा सकता है
- जिसे grade किया जा सकता है, उस decision पर model practice कर सकता है
- जिन outputs पर consensus के बिना सिर्फ debate हो सकती है, उन पर यह तरीका काम नहीं करता
- frequency और verifiability के आधार पर tool चुनना चाहिए
- high-frequency और verifiable tasks के लिए fine-tuning उपयुक्त है
- verifiable लेकिन rare tasks के लिए prompt-optimized frontier model उपयुक्त है
- non-verifiable outputs में human intervention जरूरी है
- अगर समस्या का मूल judgment नहीं बल्कि changing facts हैं, तो frequency की परवाह किए बिना retrieval augmentation उपयुक्त है
- निम्न में से एक या अधिक शर्तें पूरी हों तो task fine-tuning candidate हो सकता है
- call cost और errors इतने scale पर हों कि वे वास्तविक business cost में जमा होने लगें
- सभी outputs को humans के बिना rules, tests, rubric से verify किया जा सके
- experts सही answer के criteria पर सहमत हों
- सक्षम model कुछ success दिखाए, लेकिन भरोसेमंद consistency न दे
- सही answer संयोग से guess नहीं किया जा सकता हो
- task reasoning, tool calling और final decision के कई चरणों से बना हो
- यह अपने tools, schema और policies पर execute होता हो
- अलग-अलग error types की लागत अलग हो
- sensitive data को uncontrolled infrastructure पर नहीं भेजा जा सकता हो
- अपने boundary के भीतर model चलाने से prompts और logs बाहरी vendors तक नहीं जाते, और model·evaluation·data पर enterprise का स्वामित्व बना रहता है
दूसरे industries में specialized models के उदाहरण
- Cognition का production software लिखने·बदलने वाला model standard coding benchmarks पर GPT-5.5 से आगे है और 1,000 tokens प्रति second stream करता है
- AT&T रोज़ 9 लाख support calls का summary बनाता है और personally identifiable information को flag करता है
- GPT-4o की तुलना में PII detection performance 17% अधिक है
- GPT-4o-level accuracy के साथ fraud incidents की review 12 गुना तेज़ होती है और सालाना millions of dollars बचते हैं
- LinkedIn का job seeker·job posting matching model, जिस GPT model को उसने replace किया उससे 4% अधिक accurate है
- GPT-4 से 75 गुना और GPT-4o से 6 गुना सस्ता है
- Ambience Healthcare का medical billing code model gold panel test में 18 specialists से अधिक accurate है
- यह base prompt-driven o4-mini से 12 percentage points बेहतर है
- Phonely का phone support model 99.2% accuracy तक पहुंचा, जबकि GPT-4o 94.7% पर था
- पिछली GPT-4o configuration की तुलना में responses 73% तेज़ थे, और एक customer ने एक महीने में 350 human agents replace किए
- OpenPipe का email·support ticket model support QA में 93% score करता है, जबकि OpenAI o3 50% पर था
- यह o3 से 64 गुना सस्ता और 5 गुना तेज़ है
- Perplexity Sonar source-cited search answers में blind user tests के आधार पर GPT-4o के बराबर है
- GPT-4o से 10 गुना तेज़ और सस्ता है
- Checkr का criminal record classification model सबसे कठिन cases में GPT-4 से आगे है
- मौजूदा GPT-4 configuration की तुलना में 5 गुना सस्ता और 30 गुना तेज़ है
- हर आंकड़ा संबंधित company द्वारा replace या compete किए गए frontier models के मुकाबले self-reported result है
2 टिप्पणियां
हर मामले के लिए अलग-अलग expert ढूँढकर सिर्फ़ उनके scope का काम सौंपने के बजाय, लोगों की psychology यही होती है कि एक ही व्यक्ति को दे दें और वह अपने-आप सब कुछ अच्छे से संभाल ले।
LLM में भी reward function शायद ऐसा ही बनाया जाएगा कि आप कुछ भी फेंक दें, वह सब स्वीकार कर ले, है ना?
Hacker News की राय
बड़े research labs जिस मुख्य बात को मिस कर रहे हैं, वह यह है कि ज़्यादातर use cases में 50 PhD के बराबर ज्ञान और 12 भाषाओं की क्षमता की ज़रूरत नहीं होती, जबकि cost constraints कहीं ज़्यादा महत्वपूर्ण होते हैं
जब open-weight models और सस्ती fine-tuning आम हो जाएगी, तो ultra-large models और कर्ज़ से खड़ी की गई विशाल infrastructure की आर्थिक उपयोगिता टूट जाएगी
राजनीति या China threat theory सिर्फ सतही वजहें हैं; अगर छोटे open-weight models standard बन गए, तो बड़े research labs के लिए टिके रहना मुश्किल होगा
fine-tuning में असली महंगा हिस्सा अच्छा dataset इकट्ठा करना है, और साफ़ data होने पर भी evaluation चलाने और quality मापने की क्षमता चाहिए
engineering, data labeling, और लगातार quality review की लागत जोड़ें, तो कई use cases में शुरू से ही अच्छा काम करने वाले frontier lab models का इस्तेमाल जारी रखना ज़्यादा सस्ता पड़ता है
यह लगभग वैसा ही है जैसा करीब 10 साल पहले FAANG interview style सार्वजनिक होने पर सबने उसे ज्यों का त्यों अपनाना शुरू कर दिया था
तर्क यह है कि अभी की तरह weights बढ़ाते रहना और hardware झोंकते रहना एक dead end है, और अंततः AI के इतिहास की तरह हम फिर उद्देश्य के मुताबिक algorithms की तरफ लौटेंगे
यह साबित करने के लिए कि इतने सारे parameters की ज़रूरत नहीं है, मैं TinyToT बना रहा हूँ
ऐसी बातें देखते ही मुझे दो चीज़ें खटकती हैं
पहला, मैंने कई बार देखा है कि मौजूदा models का बेहतर इस्तेमाल करना या कुछ न करके इंतज़ार करना, retraining से बेहतर नतीजे देता है। तुलना आज के frontier model से नहीं, बल्कि उस fine-tuned model को maintain करते समय आने वाले अगले model से होनी चाहिए
दूसरा, 500 डॉलर training cost सबसे सस्ता हिस्सा है; data generation और बाद की model maintenance कहीं ज़्यादा महंगी है। scored 177,000 episodes वास्तव में बना सकने वाले use cases कितने होंगे, इस पर संदेह है
यहाँ Amazon Berkeley Objects से synthesis करना पड़ा, और अगर यह data स्वाभाविक रूप से मौजूद होता तो इसे बनाने की ज़रूरत ही न पड़ती; यही dataset खुद fine-tuning को लागू करने की कठिनाई सबसे अच्छी तरह दिखाता है
जैसे CPU के आगे बढ़ जाने के बाद भी GPU जैसे specialized hardware इस्तेमाल होते हैं, वैसे ही specialized models cost या results के मामले में general-purpose models से आगे रह सकते हैं
अगर शुरुआती training 500 डॉलर है, तो continual training खुद अपेक्षाकृत सस्ती है। data changes के मुताबिक नए examples बनाना ज़्यादा महंगा है, लेकिन उन्हें अगली model training में फिर इस्तेमाल किया जा सकता है, और model व prompt changes का evaluation करने के लिए वैसे भी कुछ हद तक इसकी ज़रूरत पड़ती है
आखिरकार data generation, training cost, या data की कमी के कारण यह हमेशा उचित नहीं होता; article के chart की तरह यह सिर्फ बार-बार होने वाले और verify किए जा सकने वाले tasks में फिट बैठता है। यह शायद सिर्फ उन बड़े enterprises के लिए व्यावहारिक हो जो लाखों decisions संभालते हैं
dataset और model maintenance की लागत भी Braintrust या Hugging Face जैसे startups के ज़रिए general-purpose service में बदली जा रही है
frontier models अपनी ही jobs खत्म करने में बहुत अच्छे हैं
GPT में भी Luna, Sol के use cases का 90% संभाल लेता है। China अब भी model distillation पर इसलिए मेहनत कर रहा है क्योंकि accurate training data generation अहम है, और OpenAI व Anthropic ने कानूनी जोखिम से बचते हुए इसे इकट्ठा करने में सालों लगाए हैं
जैसे-जैसे models ज़्यादा smart होते हैं, लोग उन सस्ते विकल्पों की ओर जाते हैं जो काम के लिए काफ़ी अच्छे हों। अगर accuracy पहले ही 99% है, तो frontier models इस्तेमाल करने का फ़ायदा लगभग नहीं बचता, और यही अमेरिकी labs के लिए सबसे बड़ा जोखिम लगता है
बाकी कामों में सस्ते models काफ़ी हैं
जैसे 2018 के आसपास खरीदे LCD TV को बदलने का मन नहीं होता, वैसे दूसरी technologies में भी ऐसा ही होता है
technologies आमतौर पर नई technologies को replace करती हैं या खाली जगहों में घुसती हैं, लेकिन human interaction जैसे non-technical क्षेत्रों को replace करना दुर्लभ है। screen के सामने होने वाली leisure activities भी ज़्यादातर parasocial relationships की ओर जाती हैं
open model fine-tuning में मेरी काफ़ी दिलचस्पी है, इसलिए मैं खुद recommend करने लायक resources ढूंढ रहा हूँ, और इस लेख को भी विस्तार से पढ़ने के लिए save करके रखा है
मैंने Nemotron-3-Nano 30B को local पर चलाया है और 30B~120B parameter models को target कर रहा हूँ। base models अपने आप में भी इतना value देते हैं कि वे व्यावहारिक रूप से उपयोगी हैं, लेकिन specialized tasks में training उस आख़िरी gap को पार करा सकती है
मुझे खास तौर पर यह पसंद आया कि लेखक पूरे process पर सोच रहा है, और मैं same use case तथा value creation strategy की पुष्टि कर सका। यह long-term project है, इसलिए fine-tuning hardware खरीदने का भी plan है
मैंने Ramp का लेख नहीं पढ़ा, लेकिन यह post hoc error जैसा लगता है। हो सकता है जिन कंपनियों की revenue 2x है उनके पास AI पर खर्च करने के लिए पैसा हो, जबकि 1.15x revenue वाली कंपनियों के पास न हो
छोटे LLM या BERT जैसे छोटे language models को fine-tune करने का तरीका LLM के शुरुआती दौर से ही सुझाया जाता रहा है। इसके स्पष्ट फायदे हैं: execution तेज़ होता है, पूरे tech stack पर नियंत्रण रखा जा सकता है, और यह किसी custom domain में बेहतर fit बैठता है
लेकिन बड़े language model API अभी भी सस्ते हैं, काफ़ी तेज़ हैं, और लगातार बेहतर हो रहे हैं, इसलिए वास्तविक fine-tuning ज़्यादा नहीं होती। क्योंकि समय और पैसा लगाकर जैसे ही कोई specialized model लॉन्च किया जाए, कोई नया general-purpose model उसे पार कर सकता है
किसी समय अगर LLM की प्रगति धीमी पड़ती है या API की कीमतें असहनीय हो जाती हैं, तो fine-tuning और छोटे models का दौर फिर लौटेगा
यह दिखाने वाला 2×2 grid पसंद आया कि मॉडल को कब fine-tune करना चाहिए और कब frontier model इस्तेमाल करना चाहिए
हालाँकि evaluator ने हर episode का score कैसे तय किया, यह स्पष्ट नहीं है। अगर grading frontier model ने की, तो यह जानना रोचक होगा कि fine-tuned model उस model से काम बेहतर करने लगे तब भी क्या evaluation वैध रहेगी
पहले Kimi K3 जैसे बड़े open model से domain-specific workflow की पूरी probability distribution को distill करना, और फिर नतीजे पर अपनी private reinforcement learning pipeline लागू करना मददगार होता है। हमने GLM 5.2 का उपयोग करके English→SQL के लिए एक private 27B model बनाया, और Fable से बेहतर परिणाम पाए, लेकिन explanation capability खो गई
बहुत अधिक specialized क्षेत्रों में frontier model को लागत के बहुत छोटे हिस्से पर पार करना मुश्किल नहीं होता। अपनी reinforcement learning pipeline न भी हो, तो सिर्फ distillation से भी बहुत लागत बचाई जा सकती है, और 27B model उस task में 3T model के काफ़ी क़रीब पहुँच सकता है
लेकिन जो tasks expert model के लिए भी ज़रूरत से ज़्यादा ambitious हों, वहाँ यह शायद काम न करे
हाल में मैं Apple के 3B Foundation Model को बहुत specific tasks में Sonnet 4.6 स्तर तक ले जाने वाली automated research में डूबा हुआ था
fine-tuning adapter और एक deterministic step को मिलाकर लगभग 90% स्तर तक पहुँचा
सवाल-जवाब, 96 experiments और lineage सहित पूरी प्रक्रिया यहाँ संकलित है: https://alexisrondeau.me/tada/research/FMDiscovery/dashboard...
bottleneck model size नहीं था, बल्कि reward function को परिभाषित करने में समस्या को सच में समझने वाले इंसान थे
समाधान को परिभाषित करने के लिए बेहतरीन programming languages बहुत हैं, लेकिन समस्या को स्पष्ट रूप से परिभाषित करने की भाषा कहाँ है, यह सवाल है