2 पॉइंट द्वारा GN⁺ 2025-08-15 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • MacBook Pro पर सिर्फ 5 मिनट में लगभग 1.8M parameters वाले GPT-स्टाइल transformer model को लगभग 20M TinyStories tokens के साथ train किया गया, और लगभग 9.6 perplexity हासिल की गई
  • 5 मिनट के भीतर training की मुख्य सीमाएँ model size और process किए जा सकने वाले tokens की संख्या हैं; model जितना बड़ा होगा, convergence उतना धीमा होगा और कम data में उसका प्रभाव भी घटेगा
  • Performance optimization में MPS का उपयोग सबसे असरदार रहा, जबकि compile/quantization/gradient accumulation और PyTorch के विकल्पों की तुलना में छोटा model चुनना अधिक प्रभावी साबित हुआ
  • TinyStories जैसे सरल और सुसंगत dataset, encyclopedic data की तुलना में छोटे models के performance पर अधिक सकारात्मक असर डालते हैं
  • Transformer architecture ने छोटे size और कम training time की शर्तों में LSTM या diffusion तरीकों की तुलना में बेहतर नतीजे दिखाए

अवलोकन

यह लेख लैपटॉप (MacBook Pro) पर 5 मिनट में train किए जा सकने वाले अधिकतम प्रदर्शन वाले AI language model पर किए गए प्रयोगों के नतीजे, और optimal training strategy, dataset selection तथा model architecture से जुड़े insights प्रस्तुत करता है

प्रयोग के नतीजों का सार

  • लगभग 1.8M parameters वाले GPT-स्टाइल transformer model को लगभग 20M TinyStories data पर train किया गया और 9.6 perplexity दर्ज की गई
  • generation examples छोटे लेकिन सुसंगत कहानी-जैसे थे, और English grammar अधिकांशतः सही बनी रही
  • इस बात पर ज़ोर दिया गया कि 5 मिनट के भीतर व्यावहारिक स्तर का model result उम्मीद से बेहतर था

प्रयोग की पृष्ठभूमि और सीमाएँ

  • लैपटॉप environment में शक्तिशाली model को तेज़ी से train करना एक व्यावहारिक आवश्यकता से अधिक जिज्ञासा-आधारित प्रयोग था
  • वास्तव में cloud में high-performance GPU (H100 आदि) के साथ इससे कहीं अधिक शक्तिशाली model train किए जा सकते हैं, लेकिन इस प्रयोग की सीमा समय (5 मिनट) थी
  • जैसे-जैसे model size बढ़ता है, token processing speed धीमी हो जाती है, इसलिए 5 मिनट के भीतर अच्छे नतीजे पाना कठिन हो जाता है
    • बहुत छोटे model (जैसे 10K parameters) पर्याप्त जटिलता सीख नहीं पाते
    • व्यावहारिक सीमा लगभग 1M~2M parameters वाले models की है

throughput optimization

  • MPS (Apple का Metal Performance Shaders) का उपयोग सबसे प्रभावी रहा
  • torch.compile, float16, MLX जैसी विभिन्न mathematical optimizations से उम्मीद के मुताबिक performance सुधार नहीं मिला, बल्कि कुछ मामलों में गिरावट आई
  • Gradient accumulation memory management के लिए उपयोगी हो सकता है, लेकिन व्यवहार में इससे speed पर गंभीर असर पड़ा
  • model ऐसा होना चाहिए कि वह internal memory में तेज़ी से weight update कर सके, तभी दक्षता मिलती है

dataset selection

  • सीमित token count (लगभग 10~20M) के साथ Simple English Wikipedia जैसे सरल English wiki data का पहले उपयोग किया गया, जिसमें grammatical consistency तो मिली, लेकिन semantic consistency कम रही
    • proper nouns पर अधिक निर्भरता और बनावटी लगने वाले facts की सूची के कारण सार्थक content generation सीमित रहा
  • TinyStories dataset के उपयोग पर कहानी की संरचना स्पष्ट और भाषा सरल होने से नतीजे कहीं अधिक सुसंगत और अर्थपूर्ण रहे
    • यह 4-वर्षीय स्तर की stories का dataset है, इसलिए छोटे models पर भी training अच्छी तरह हुई

tokenizer और tokenization

  • tokenizer training को 5 मिनट की सीमा में शामिल नहीं किया गया, और data scale छोटा होने से optimization की आवश्यकता भी कम थी
  • multibyte tokens सीखना model training के लिए अधिक आसान था

model architecture experiments

  • Transformer (GPT-2 style) architecture का उपयोग किया गया

    • 2~3 layers, SwiGLU जैसी activation functions, positional embedding आदि hyperparameters को समायोजित किया गया
    • LSTM का performance काफ़ी करीब था, लेकिन perplexity के लिहाज़ से transformer बेहतर रहा
    • Dropout, mixture-of-experts आदि इतने छोटे scale पर अप्रभावी रहे
    • Curriculum learning का असर बहुत कम रहा क्योंकि training time बहुत छोटा था
  • Diffusion model (D3PM) का भी प्रयास किया गया

    • प्राकृतिक भाषा discrete tokens से बनी होती है, इसलिए diffusion process में केवल अर्थहीन random tokens बनते रहे और प्रयोग असफल रहा
    • transformer या LSTM की तुलना में तेज़ी से sentence structure बनाना कठिन था

model size और tokens/sec throughput का संबंध

  • 1M~2M parameters वाले models सबसे आदर्श sweet spot साबित हुए
    • बहुत बड़े model 5 मिनट में converge नहीं कर पाते, और बहुत छोटे model training शुरू होते ही performance limit तक पहुँच जाते हैं
  • Chinchilla scaling law और प्रयोग के नतीजे मोटे तौर पर एक-दूसरे से मेल खाते हैं
    • कुल training tokens/20 आदर्श model size माना जाता है, और इस प्रयोग में भी यह बात देखी गई

निष्कर्ष और संकेत

  • बहुत कम समय और छोटे hardware पर भी सुसंगत storytelling model को train करना संभव है
  • 5 मिनट की training शक्तिशाली model development के लिए उपयुक्त नहीं है, लेकिन छोटे और ultra-lightweight models के design तथा hardware और architecture optimization experiments के लिए इसका महत्व है
  • आगे चलकर लैपटॉप GPU और model structures में प्रगति होने पर, सिर्फ कुछ मिनटों में train होने वाले models का performance और बेहतर हो सकता है

1 टिप्पणियां

 
GN⁺ 2025-08-15
Hacker News राय
  • वह उनके quantum cryptography वाले व्याख्यान को देखना चाहता है, और पूछ रहा है कि क्या किसी को वीडियो की शुरुआत में जिस व्याख्यान का ज़िक्र है उसका लिंक पता है

  • छोटे models की optimized training सिर्फ accessibility के लिए ही नहीं बल्कि LLM के वैज्ञानिक शोध के लिए भी महत्वपूर्ण है; जैसे biology research में yeast जैसे simple organisms का उपयोग होता है, वैसे ही समझ और control के लिए बड़े models के रोचक व्यवहार दिखाने वाले सबसे सरल transformer का अध्ययन करना ज़रूरी है

    • हाल में सुने गए सबसे प्रभावशाली podcasts में से एक Tiny Stories paper और dataset पर था; इस dataset में सिर्फ बच्चों की कहानी जैसी सरल शब्दावली और concepts हैं, लेकिन इससे छोटे models भी grammar, diversity, और reasoning के साथ English generate कर पाते हैं; लेखकों के साथ podcast खुद भी छोटे और नियंत्रित research examples के ज़रिए LLM की क्षमताओं को शानदार ढंग से समझाता है; biological analogy में dataset शायद बहुत सरल और नियंत्रित environment वाले agar plate जैसा है; संबंधित लिंक हैं podcast episode, TinyStories paper

    • कई कंपनियाँ user purchase history जैसे private datasets का उपयोग करके छोटे models से वास्तविक business problems हल कर सकती हैं; बड़े language models से आई प्रगति को छोटे problems पर वैसे ही लागू किया जा सकता है, अगर input sequence को किसी specialized language में व्यक्त किया जा सके

    • यह व्यापक रूप से जाना जाता है कि छोटे models में दिखने वाले behavior और optimization बड़े models में अच्छी तरह reproduce नहीं होते

    • यहाँ लेखक pretraining कर रहा है; यह आम तौर पर Google या Meta जैसे model makers का काम होता है, जबकि business के लिए finetuning या (कुछ कम हद तक) additional pretraining कहीं अधिक practical है; वह इस बात पर ज़ोर देता है कि लेखक यह शैक्षणिक कारणों से कर रहा है

    • उसे उन models में दिलचस्पी है जो laptop पर तेज़ी से चलते हैं, लेकिन training process खुद कुछ दिन या उससे भी ज़्यादा ले सकता है

  • उसका मानना है कि समय की जगह energy को मापदंड बनाना अच्छा होगा; यानी joule में दिए गए energy budget के भीतर सबसे अच्छा model train करना ही असली तुलना होगी, और तब MBP और H100 के बीच तुलना भी अधिक निष्पक्ष होगी

    • यहाँ मुख्य बात efficiency नहीं बल्कि ‘accessibility’ है, क्योंकि H100 रोज़मर्रा का product नहीं है, लेकिन laptop है

    • उसकी समझ के अनुसार power consumption के मामले में Mac अधिक competitive है, क्योंकि वह Nvidia GPU की तरह बहुत ज़्यादा बिजली नहीं खींचता; वैसे H100 को 10 डॉलर प्रति घंटा से कम में किराए पर लिया जा सकता है, इसलिए 1 घंटे के भीतर train होने वाले model के performance की तुलना करना भी दिलचस्प हो सकता है

    • उसका मानना है कि कोई भी मानदंड ठीक है; थोड़ा arbitrary होना भी बुरा नहीं है

    • अगर उद्देश्य metric को laptop-based या MacBook Pro-based रूप में व्यक्त करना है, तो वह चाहता है कि मकसद और स्पष्ट बताया जाए

  • अब तो लगता है AI efficiency olympics करानी चाहिए—laptop हो, desktop हो, phone हो, 5 मिनट हो, 1 घंटा हो, 1 दिन हो, 1 हफ़्ता हो, नाव पर हो या बकरी के साथ हो, कहीं भी चलेगा—यह बात उसने मज़ाकिया अंदाज़ में कही

    • बकरी के साथ? शायद उसका मतलब Llama से है; rhyme तो सीमित है, लेकिन Boston accent में यह और मज़ेदार लगेगा

    • Vernor Vinge के एक उपन्यास में इंसान portable chess computer बनाकर मैच के दौरान assistant की तरह इस्तेमाल करते हैं; अगर tournament में chess clock के अलावा power भी दी जाए, तो खिलाड़ी अपनी AI के लिए फ़ायदेमंद चालों पर विचार कर सकते हैं, जो काफ़ी अनोखा होगा

    • Mac Studio M3 Ultra 512GB से चरम performance निकालने वाली अतिशयोक्तिपूर्ण पंक्ति, जैसे उस नाव से तो बकरी भी तैराई जा सकती है—ऐसा मज़ाक

    • मज़ाक यह भी कि बकरी में parameters इतने ज़्यादा हैं कि वह लगभग GPT-4 स्तर की है

    • अगर GoatLM आया, तो वह उसके लिए पैसे देने को तैयार है

  • उसे "Paris, France is a city in North Carolina..." जैसे बकवास उदाहरण में officially major people वाली अभिव्यक्ति पसंद आई, और वह सोच रहा है कि इसे रोज़मर्रा की बातचीत में कैसे इस्तेमाल किया जा सकता है

  • किसी ने कहा कि यह उसे कुछ साल पहले के “cramming” paper की याद दिलाता है, और paper link साझा किया जिसमें लेखक ने एक दिन के भीतर आधुनिक laptop पर optimal model train करने की कोशिश की थी

  • उसका मानना है कि GPT-2 speedrun प्रयास से लाए गए कुछ tricks—Muon, बेहतर weight initialization, और सावधानीपूर्वक learning rate tuning—ही लागू कर दिए जाएँ तो चीज़ें काफ़ी बेहतर हो सकती हैं; संबंधित सामग्री यहाँ है

  • उसका मानना है कि AI में demoscene की कमी है, यानी 90s के graphics demo shows जैसी वह संस्कृति जिसमें बहुत कम resources पर तकनीकी कमाल दिखाया जाता था

  • उसे लगता है कि छोटे, अधिक specialized models बनाना और ज़रूरत पड़ने पर तुरंत बना लेना भी काफ़ी मूल्यवान है; हर चीज़ जानने वाला बड़ा model ज़रूरी नहीं, बल्कि उसके काम के domain पर laser-focus करके बहुत तेज़ चलने वाला model ज़्यादा उपयोगी है; वह चाहता है कि वह किसी बड़े LLM से कह सके, “<needed task> के लिए optimized model train करने वाली script लिख दो,” और फिर उसी model को चला सके; लेकिन यह comment लिखते-लिखते ही Google ने Gemma 3 270M जारी कर दिया

    • वास्तव में machine learning में एक trend यह भी है कि general-purpose models अक्सर किसी विशेषज्ञ के अपने task पर भी उससे बेहतर performance दे देते हैं
  • "Paris, France is a city in North Carolina..." जैसी बकवास output का उदाहरण देते हुए किसी ने कहा कि अगर सिर्फ “मुझे नहीं पता (I don't know)” कहने की तकनीक आ जाए, तो छोटे models बहुत अधिक उपयोगी हो जाएँगे; बहुत बड़े LLM की ज़रूरत इसलिए पड़ती है कि उनकी coverage बहुत व्यापक होती है और वे बातें गढ़ने से बेहतर बचते हैं; laptop पर उचित समय में customer support chatbot train करना संभव हो जाए तो अच्छा होगा, लेकिन उस domain के बाहर उसके गंभीर रूप से उलटे-सीधे जवाब देने की संभावना बहुत अधिक रहेगी

    • उसका मानना है कि laptop पर सिर्फ 5 मिनट में train किए गए AI से छोटे models की सीमाएँ तय करना उचित नहीं है; hallucination की समस्या निश्चित रूप से अब भी बड़ी है, लेकिन उसे नहीं लगता कि उस लेख से इस पहलू पर कोई खास insight मिला