- 2017 में सामने आया Transformer मशीन अनुवाद से शुरू होकर लगभग हर क्षेत्र तक फैल गया है, और आधुनिक इंजीनियरों के लिए जानना जरूरी एक मुख्य AI ज्ञान बन चुका है
- यह गाइड इंजीनियरों को Transformer समझने के लिए जितनी जरूरत हो उतना ही फॉलो करने में मदद करने हेतु न्यूरल नेटवर्क से attention तक चरणबद्ध तरीके से व्यवस्थित है
- इसमें सीधे चलाए जा सकने वाले Python कोड उदाहरण और संदर्भ सामग्री साथ दी गई है, ताकि सीखना सिर्फ पढ़ने तक सीमित न रहे बल्कि हाथ से चलाकर समझा जा सके
- मुख्य लेख को न्यूरल नेटवर्क, RNN, NLP और attention, Transformer, तथा Python·गणित की बुनियादी appendix में बाँटा गया है, और PyTorch व LLM-आधारित Multi-Agents अनुभाग भी जोड़े गए हैं
- शिक्षा और गैर-व्यावसायिक उपयोग की शर्तें अपेक्षाकृत खुली हैं, लेकिन पूछताछ के समय सत्यापन के लिए 2 या उससे अधिक SNS पते माँगे जाते हैं, इसलिए गुमनाम संपर्क पर कुछ सीमाएँ हैं
Transformer को समझने के लिए सीखने का मार्ग
- The Engineer’s Guide To Deep Learning इंजीनियरों को Transformer समझने के लिए आवश्यक न्यूनतम मार्ग देने वाली एक संक्षिप्त गाइडबुक है
- वर्तमान AI को तीसरे स्वर्णकाल के रूप में देखा जाता है
- इससे पहले के दो स्वर्णकाल 1950~1960 के दशक और 1980 के दशक थे
- उस समय अपेक्षाएँ तकनीकी क्षमता से आगे निकल गई थीं, जिससे निराशा पैदा हुई
- 2010 के दशक के मध्य से शुरू हुआ मौजूदा AI स्वर्णकाल लगातार अपेक्षाओं से आगे बढ़ने वाली धारा के रूप में समझाया जाता है
- Transformer 2017 में पेश किया गया एक breakthrough था
- शुरुआत में इसे मशीन अनुवाद मॉडल के रूप में विकसित किया गया था
- बाद में इसका प्रभाव लगभग सभी क्षेत्रों तक फैल गया
- सीखने में मदद के लिए चलाने योग्य Python कोड उदाहरण दिए गए हैं
- हर पाठक अपनी जरूरत के मुताबिक सामग्री चुन सके, इसके लिए अतिरिक्त संदर्भ सामग्री भी साथ में परिचित कराई गई है
दस्तावेज़ की संरचना और अपडेट
- गाइड को इस तरह बनाया गया है कि Transformer में सीधे कूदने के बजाय पहले जरूरी बुनियाद क्रम से बनाई जाए
- Part 1: Neural Networks — न्यूरल नेटवर्क की बुनियादी अवधारणाएँ
- Part 2: Recurrent Neural Networks (RNNs) — RNN, LSTM, GRU
- Part 3: Natural Language Processing (NLP) and Attention Mechanisms — मशीन अनुवाद और attention सहित NLP के मुख्य सिद्धांत
- Part 4: Transformer — Transformer मॉडल
- Appendix: Basic Knowledge — Transformer को समझने के लिए जरूरी न्यूनतम Python और गणित ज्ञान
- बदलाव का इतिहास 21 मई 2024 को पहले संस्करण के प्रकाशित होने के बाद से जारी है
- 23 जुलाई 2024: Parts 1·2 में PyTorch संस्करण जोड़ा गया
- 16 सितंबर 2024: LLM-आधारित Multi-Agents सेक्शन जोड़ा गया
- आगे चलकर इसमें वर्तमान में विकसित हो रही कई Transformer-आधारित तकनीकों और निकट भविष्य की किसी दूसरी बड़ी breakthrough को भी शामिल किया जा सकता है
उपयोग की शर्तें और संपर्क का तरीका
- कॉपीराइट FAQ में उपयोग की शर्तें शिक्षा और गैर-व्यावसायिक उपयोग के लिए अपेक्षाकृत खुली हैं
- शैक्षणिक संस्थानों के शिक्षक और छात्र सीखने के उद्देश्य से दस्तावेज़ों और चित्रों का स्वतंत्र रूप से उपयोग कर सकते हैं
- गैर-व्यावसायिक बैठकों और व्याख्यानों में, साइट लिंक और कॉपीराइट स्पष्ट करने पर दस्तावेज़ों और चित्रों का उपयोग किया जा सकता है
- व्यावसायिक उपयोग अनुभाग में revenue share और full buyout का विवरण मज़ाक के रूप में लिखा गया है, और लेखक ने स्पष्ट किया है कि उसका कोई व्यावसायिक संबंध बनाने का इरादा नहीं है
- पूछताछ ईमेल में सत्यापन के लिए LinkedIn, Twitter जैसे कम से कम 2 SNS पते देने होंगे
- XZ backdoor घटना के बाद से गुमनाम व्यक्तियों के संपर्क स्वीकार नहीं किए जाते
1 टिप्पणियां
Hacker News की राय
Transformers from Scratch: https://e2eml.school/transformers.html
Andrej Karpathy की परिचयात्मक सीरीज़ भी अच्छी है: https://karpathy.ai/zero-to-hero.html
Let's build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
3Blue1Brown का “But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning”: https://www.youtube.com/watch?v=wjZofJX0v4M
“Attention in transformers, visually explained | Chapter 6, Deep Learning”: https://www.youtube.com/watch?v=eMlx5fFNoYc
पूरी 3Blue1Brown neural networks playlist: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
Keras tutorial के हिसाब से यह काफी महंगा है
पिछले साल के विजेता solutions समझने के बाद कोई छोटा sub-task चुनने की योजना है: https://scrollprize.org/
उदाहरण के लिए LSTM के gradients को expand करने वाला हिस्सा आपके पसंदीदा framework में implementation कराने के लिए नहीं, बल्कि समझ में मदद करने के लिए है
कई frameworks में solutions दिखाने का मकसद भी formulas कैसे दिखते हैं और code में वे कैसे दिख सकते हैं, इनके बीच connection बनाना है
खासकर Transformer architecture की interesting बात यह है कि attention mechanism permutation-invariant है। अगर लोग इस unique property को offset करने के लिए positional embeddings न इस्तेमाल करें तो यह और भी साफ दिखता है, और graph के specific nodes या individual edges तक arbitrarily mask किए जा सकते हैं, इसलिए domain knowledge को architecture में शामिल करने की flexibility काफी ज्यादा है
कई cases में positional embeddings अब भी जरूरी हो सकते हैं, लेकिन attention layer input को सिर्फ simple 1D sequence मानने वाली बहुत restrictive सोच से बाहर निकलकर इसे ज्यादा smart तरीके से design किया जा सकता है
मेरी समझ में ML engineer वह engineer है जो PyTorch जैसे framework से models बनाता है, AI engineer वह engineer है जो prompt engineering या OpenAI/Claude API जैसे AI solutions के ऊपर applications बनाता है, और MLOps वे लोग हैं जो model deployment और serving में मदद करते हैं; क्या यह distinction सही है?
असल में ऊपर के roles “cutting-edge research करता है” से लेकर “कभी एक बार CSV खोलकर देखा है” तक सब कुछ cover कर सकते हैं
अगर impact बनाना है, तो उसी में बहुत अच्छे हो जाइए। यह skill systems integration या business analysis जैसे areas में भी काम आती है, और algorithms—और आजकल trained models भी—research करने वाले लोग दे सकते हैं
Technologists के बीच भी social networks को identity और trust verification के साधन के रूप में अपनते देखना काफी कड़वा लगता है। कुछ governments ने visa/immigration screening में social network usernames मांगना शुरू किया था, वह भी काफी खराब था; अब क्या किसी technologist को email भेजने के लिए भी social proof चाहिए?
XZ attacker शायद बहुत सारी services में GitHub से login कर सकता था। Original author भी शायद PyPI से कुछ download करता होगा, जो 1 साल से ज्यादा समय तक unattended token leak के कारण potentially compromised था
साथ ही, machine learning field में होने के कारण वह GitHub, conda, PyPI से audit करना मुश्किल वाले बड़े Python frameworks download करता होगा, और इस field के लोग untrusted models भी download करके experiment करते हैं
लेकिन issue वह plaintext email है जिसे MIME और अन्य extensions बंद किए हुए command-line mail client में पढ़ा जा सकता है?