8 पॉइंट द्वारा GN⁺ 2024-07-17 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • 2017 में सामने आया Transformer मशीन अनुवाद से शुरू होकर लगभग हर क्षेत्र तक फैल गया है, और आधुनिक इंजीनियरों के लिए जानना जरूरी एक मुख्य AI ज्ञान बन चुका है
  • यह गाइड इंजीनियरों को Transformer समझने के लिए जितनी जरूरत हो उतना ही फॉलो करने में मदद करने हेतु न्यूरल नेटवर्क से attention तक चरणबद्ध तरीके से व्यवस्थित है
  • इसमें सीधे चलाए जा सकने वाले Python कोड उदाहरण और संदर्भ सामग्री साथ दी गई है, ताकि सीखना सिर्फ पढ़ने तक सीमित न रहे बल्कि हाथ से चलाकर समझा जा सके
  • मुख्य लेख को न्यूरल नेटवर्क, RNN, NLP और attention, Transformer, तथा Python·गणित की बुनियादी appendix में बाँटा गया है, और PyTorch व LLM-आधारित Multi-Agents अनुभाग भी जोड़े गए हैं
  • शिक्षा और गैर-व्यावसायिक उपयोग की शर्तें अपेक्षाकृत खुली हैं, लेकिन पूछताछ के समय सत्यापन के लिए 2 या उससे अधिक SNS पते माँगे जाते हैं, इसलिए गुमनाम संपर्क पर कुछ सीमाएँ हैं

Transformer को समझने के लिए सीखने का मार्ग

  • The Engineer’s Guide To Deep Learning इंजीनियरों को Transformer समझने के लिए आवश्यक न्यूनतम मार्ग देने वाली एक संक्षिप्त गाइडबुक है
  • वर्तमान AI को तीसरे स्वर्णकाल के रूप में देखा जाता है
    • इससे पहले के दो स्वर्णकाल 1950~1960 के दशक और 1980 के दशक थे
    • उस समय अपेक्षाएँ तकनीकी क्षमता से आगे निकल गई थीं, जिससे निराशा पैदा हुई
    • 2010 के दशक के मध्य से शुरू हुआ मौजूदा AI स्वर्णकाल लगातार अपेक्षाओं से आगे बढ़ने वाली धारा के रूप में समझाया जाता है
  • Transformer 2017 में पेश किया गया एक breakthrough था
    • शुरुआत में इसे मशीन अनुवाद मॉडल के रूप में विकसित किया गया था
    • बाद में इसका प्रभाव लगभग सभी क्षेत्रों तक फैल गया
  • सीखने में मदद के लिए चलाने योग्य Python कोड उदाहरण दिए गए हैं
  • हर पाठक अपनी जरूरत के मुताबिक सामग्री चुन सके, इसके लिए अतिरिक्त संदर्भ सामग्री भी साथ में परिचित कराई गई है

दस्तावेज़ की संरचना और अपडेट

  • गाइड को इस तरह बनाया गया है कि Transformer में सीधे कूदने के बजाय पहले जरूरी बुनियाद क्रम से बनाई जाए
  • बदलाव का इतिहास 21 मई 2024 को पहले संस्करण के प्रकाशित होने के बाद से जारी है
    • 23 जुलाई 2024: Parts 1·2 में PyTorch संस्करण जोड़ा गया
    • 16 सितंबर 2024: LLM-आधारित Multi-Agents सेक्शन जोड़ा गया
  • आगे चलकर इसमें वर्तमान में विकसित हो रही कई Transformer-आधारित तकनीकों और निकट भविष्य की किसी दूसरी बड़ी breakthrough को भी शामिल किया जा सकता है

उपयोग की शर्तें और संपर्क का तरीका

  • कॉपीराइट FAQ में उपयोग की शर्तें शिक्षा और गैर-व्यावसायिक उपयोग के लिए अपेक्षाकृत खुली हैं
    • शैक्षणिक संस्थानों के शिक्षक और छात्र सीखने के उद्देश्य से दस्तावेज़ों और चित्रों का स्वतंत्र रूप से उपयोग कर सकते हैं
    • गैर-व्यावसायिक बैठकों और व्याख्यानों में, साइट लिंक और कॉपीराइट स्पष्ट करने पर दस्तावेज़ों और चित्रों का उपयोग किया जा सकता है
    • व्यावसायिक उपयोग अनुभाग में revenue share और full buyout का विवरण मज़ाक के रूप में लिखा गया है, और लेखक ने स्पष्ट किया है कि उसका कोई व्यावसायिक संबंध बनाने का इरादा नहीं है
  • पूछताछ ईमेल में सत्यापन के लिए LinkedIn, Twitter जैसे कम से कम 2 SNS पते देने होंगे
  • XZ backdoor घटना के बाद से गुमनाम व्यक्तियों के संपर्क स्वीकार नहीं किए जाते

1 टिप्पणियां

 
GN⁺ 2024-07-17
Hacker News की राय
  • इससे बेहतर सामग्री काफी मौजूद है। The Annotated Transformer / Attention is All You Need: http://nlp.seas.harvard.edu/annotated-transformer/
    Transformers from Scratch: https://e2eml.school/transformers.html
    Andrej Karpathy की परिचयात्मक सीरीज़ भी अच्छी है: https://karpathy.ai/zero-to-hero.html
    Let's build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
    GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
    3Blue1Brown का “But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning”: https://www.youtube.com/watch?v=wjZofJX0v4M
    “Attention in transformers, visually explained | Chapter 6, Deep Learning”: https://www.youtube.com/watch?v=eMlx5fFNoYc
    पूरी 3Blue1Brown neural networks playlist: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
    • जोड़ दूं कि ऊपर की सभी साइटें मुफ्त हैं। यहां पोस्ट की गई साइट कहती है कि “पूरा content और GitHub repository के पूर्ण commercial usage rights खरीदने की कीमत €10,000,000” है, और commercial use पर 20% royalty भी मांगती है
      Keras tutorial के हिसाब से यह काफी महंगा है
    • थोड़ा अलग सवाल है, लेकिन मैं Vesuvius Challenge में हिस्सा लेना चाहता हूं; मेरा machine learning background नहीं है और मैं सामान्य web developer हूं। क्या Karpathy की Zero to Hero और Understanding Deep Learning किताब से practical machine learning background बनाना काफी होगा, या और कुछ सीखना पड़ेगा?
      पिछले साल के विजेता solutions समझने के बाद कोई छोटा sub-task चुनने की योजना है: https://scrollprize.org/
    • Lucas Beyer की slides भी काफी अच्छी हैं: https://docs.google.com/presentation/d/1ZXFIhYczos679r70Yu8v...
  • Transformer tutorials अब नए Monad tutorials जैसे हो गए लगते हैं
  • यह material perceptron से Transformer तक बहुत compressed तरीके से तेजी से overview देता है
    उदाहरण के लिए LSTM के gradients को expand करने वाला हिस्सा आपके पसंदीदा framework में implementation कराने के लिए नहीं, बल्कि समझ में मदद करने के लिए है
    कई frameworks में solutions दिखाने का मकसद भी formulas कैसे दिखते हैं और code में वे कैसे दिख सकते हैं, इनके बीच connection बनाना है
  • Transformer documents में सबसे frustrating बात यह है कि लगभग सभी सिर्फ natural language processing पर focus करते हैं
    खासकर Transformer architecture की interesting बात यह है कि attention mechanism permutation-invariant है। अगर लोग इस unique property को offset करने के लिए positional embeddings न इस्तेमाल करें तो यह और भी साफ दिखता है, और graph के specific nodes या individual edges तक arbitrarily mask किए जा सकते हैं, इसलिए domain knowledge को architecture में शामिल करने की flexibility काफी ज्यादा है
    कई cases में positional embeddings अब भी जरूरी हो सकते हैं, लेकिन attention layer input को सिर्फ simple 1D sequence मानने वाली बहुत restrictive सोच से बाहर निकलकर इसे ज्यादा smart तरीके से design किया जा सकता है
  • Machine learning/AI experts से पूछना चाहता हूं। CRUD/backend API से ML/AI field में switch करना चाहने वाले व्यक्ति के लिए कोई intro resources हों तो share करें। Field में कई branches हैं, इसलिए समझ नहीं आता कहां से शुरू करूं
    मेरी समझ में ML engineer वह engineer है जो PyTorch जैसे framework से models बनाता है, AI engineer वह engineer है जो prompt engineering या OpenAI/Claude API जैसे AI solutions के ऊपर applications बनाता है, और MLOps वे लोग हैं जो model deployment और serving में मदद करते हैं; क्या यह distinction सही है?
    • इन terms की कोई official definition नहीं है। बस एक association rule चाहिए: सुनने में plausible job title → company जो चाहे उसका मतलब हो सकता है
      असल में ऊपर के roles “cutting-edge research करता है” से लेकर “कभी एक बार CSV खोलकर देखा है” तक सब कुछ cover कर सकते हैं
    • Machine learning projects के time का 85% data quality और थोड़ी domain-specific feature engineering पर खर्च होगा
      अगर impact बनाना है, तो उसी में बहुत अच्छे हो जाइए। यह skill systems integration या business analysis जैसे areas में भी काम आती है, और algorithms—और आजकल trained models भी—research करने वाले लोग दे सकते हैं
    • “AI engineer” को software में machine learning integrate करने में specialized application engineer कहना ज्यादा सही होगा
    • Kaggle अच्छा starting point है
  • Introduction के कुछ paragraphs के अलावा कोई content नहीं है। असली content पर 404 not found आता है
    • Body के अंदर links टूटे हुए हैं। hamburger menu के links सही काम कर रहे हैं
    • Desktop के left menu काम करता है। लगता है सिर्फ first page के links टूटे हैं
  • “Email भेजते समय verification के लिए LinkedIn, Twitter जैसे कम से कम दो SNS addresses दें… anonymous individuals से contact अब स्वीकार नहीं किया जाता” जैसी line दिखती है
    Technologists के बीच भी social networks को identity और trust verification के साधन के रूप में अपनते देखना काफी कड़वा लगता है। कुछ governments ने visa/immigration screening में social network usernames मांगना शुरू किया था, वह भी काफी खराब था; अब क्या किसी technologist को email भेजने के लिए भी social proof चाहिए?
    • “anonymous individuals से contact अब स्वीकार नहीं किया जाता” वाली बात air force headquarters recruiting center में किसी व्यक्ति के पहुंचने वाले joke की याद दिलाती है। वे पूछते हैं, “Pilot license? Experience? Qualifications?” और जवाब आता है, “नहीं। मैं बस यह बताने आया हूं कि मुझसे उम्मीद मत रखना!”
    • छोड़ा गया हिस्सा खोलें तो लिखा है: “XZ backdoor incident के कारण anonymous individuals से contact अब स्वीकार नहीं किया जाता”
      XZ attacker शायद बहुत सारी services में GitHub से login कर सकता था। Original author भी शायद PyPI से कुछ download करता होगा, जो 1 साल से ज्यादा समय तक unattended token leak के कारण potentially compromised था
      साथ ही, machine learning field में होने के कारण वह GitHub, conda, PyPI से audit करना मुश्किल वाले बड़े Python frameworks download करता होगा, और इस field के लोग untrusted models भी download करके experiment करते हैं
      लेकिन issue वह plaintext email है जिसे MIME और अन्य extensions बंद किए हुए command-line mail client में पढ़ा जा सकता है?
  • Basics से संक्षेप में build up करने के लिए बहुत अच्छा material है