मशीन लर्निंग में Pen and Paper अभ्यास (2022)
(arxiv.org)- Pen & Paper उन पाठकों के लिए मशीन लर्निंग के विस्तृत व्याख्यात्मक अभ्यास प्रश्नों का संग्रह है, जो पहले से सिद्धांत और अवधारणाओं से परिचित हैं और प्रश्न हल करके अपनी समझ को गहरा करना चाहते हैं
- जब किताबों और लेक्चरों में अभ्यास प्रश्नों के हल बहुत छोटे हों या बिल्कुल न हों, तो सीखने का अवसर आसानी से हताशा में बदल सकता है; इसलिए इसका लक्ष्य ऐसा विस्तृत समाधान स्तर देना है, जिसे चरण-दर-चरण फॉलो किया जा सके
- कोडिंग और simulation भी महत्वपूर्ण हैं, लेकिन अधिकांश प्रश्नों को पेन और कागज़ से हल करने लायक बनाया गया है, ताकि गणितीय सोच को मजबूत करने पर फोकस रहे
- प्रश्न मुख्य रूप से University of Helsinki के “Unsupervised Machine Learning” और University of Edinburgh के “Probabilistic Modelling and Reasoning” लेक्चरों के प्रश्नों को मिलाकर बनाए गए हैं, और इसका दायरा unsupervised methods, inference, और learning पर केंद्रित है
- Michael Gutmann चाहते हैं कि यह प्रश्न-संग्रह लगातार बढ़ता रहे, और इसके लिए LaTeX source को सार्वजनिक किया गया है, GitHub issue के ज़रिये त्रुटि रिपोर्ट करने और बड़े योगदान के लिए सीधे संपर्क करने का मार्ग बताया गया है
अभ्यास प्रश्नों से समझ को गहरा करने वाली किताब
- “use it or lose it” वाली कहावत की तरह, किसी skill का अभ्यास न किया जाए तो वह कमजोर पड़ जाती है, और नई skills सीखते समय भी बार-बार उनका उपयोग करना ज़रूरी होता है
- कई किताबें और lecture अभ्यास प्रश्न देते हैं, लेकिन जब उनके समाधान बहुत छोटे हों या न हों, तो प्रश्न हल करना हताशा का कारण बन सकता है और लोग उन्हें छोड़ देते हैं
- यह किताब विस्तृत हलों के साथ अभ्यास प्रश्नों का संग्रह है
- इसका लक्ष्य इतना विस्तार देना है कि पाठक समाधान को फॉलो करते हुए इस्तेमाल की गई techniques को समझ सकें
- यह मशीन लर्निंग की किताबों या lectures का विकल्प नहीं है
- यह उन स्थितियों के लिए बनाई गई है जहाँ पाठक संबंधित सिद्धांत और अवधारणाएँ पहले देख चुके हों और अब प्रश्न हल करके समझ को मजबूत करना चाहते हों
पेन और कागज़ केंद्रित संरचना
- मशीन लर्निंग में coding और computer simulation बहुत महत्वपूर्ण हैं
- लेकिन इस किताब के अधिकांश प्रश्न पेन और कागज़ से हल किए जा सकते हैं
- पेन और कागज़ पर आधारित यह संरचना सामग्री को संक्षिप्त रखती है और व्याख्या को सरल बनाती है
- इससे गणितीय क्षमता को मजबूत करने में मदद मिलती है
- अगर इसे computer practice के साथ इस्तेमाल किया जाए, तो अवधारणाओं की समझ और गहरी हो सकती है
शामिल विषय और दायरा
- प्रश्न मुख्य रूप से दो courses में विकसित सामग्री को मिलाकर बनाए गए हैं
- University of Helsinki का “Unsupervised Machine Learning”
- University of Edinburgh का “Probabilistic Modelling and Reasoning”
- यह मशीन लर्निंग के पूरे क्षेत्र को कवर नहीं करता
- इसका फोकस unsupervised methods, inference, और learning पर स्पष्ट रूप से है
- दिए गए पाठ में Chapter 1 Linear Algebra के उदाहरण के रूप में Gram–Schmidt orthogonalization का एक प्रश्न शामिल है
- दो vectors से बने
u1,u2के एक-दूसरे के orthogonal होने की पुष्टि inner product से की जाती है - यदि
a2,a1का multiple हो, तो orthogonalization प्रक्रिया मेंu2zero vector बन जाता है - यह दिखाया जाता है कि linearly independent
a1,a2के किसी भी linear combination कोu1,u2के रूप में फिर से लिखा जा सकता है
- दो vectors से बने
विस्तार और योगदान का तरीका
- लक्ष्य यह है कि समय के साथ नए प्रश्न जोड़कर यह प्रश्न-संग्रह और बड़ा होता जाए
- LaTeX source code GitHub repository में सार्वजनिक रूप से उपलब्ध है
- गलतियाँ या टाइपो GitHub issue के माध्यम से रिपोर्ट की जा सकती हैं
- बड़े योगदान के लिए सीधे संपर्क करने का तरीका भी बताया गया है
1 टिप्पणियां
Hacker News टिप्पणियां
देखने में शानदार है, लेकिन मशीन लर्निंग पढ़ते समय सबसे निराशाजनक बात यह है कि सिद्धांत में चाहे जितना गहराई तक जाएं, यह साफ़ नहीं दिखता कि वह वास्तविक choices से कैसे जुड़ता है
उदाहरण के लिए, एक layer में neurons की संख्या, layers की संख्या, activation function, neural network इस्तेमाल करना है या कोई दूसरी technique—ऐसे फैसलों में theory कैसे मदद करती है, यह जानना चाहता हूं
बस इधर-उधर random चीजें आज़माकर जो काम करे उसे खोजते हैं, एक-दूसरे के ideas कॉपी करते हैं, और धीरे-धीरे धुंधले guidelines बन जाते हैं
अगर आपको logical और explainable चीज चाहिए, तो यह लगभग सबसे खराब field है; ज्यादातर काम dataset को label करना, compute cost चुकाना, और उम्मीद करना कि सब ठीक चलेगा, यही है
machine learning में हर चीज theory से derive नहीं की जा सकती। अगर ऐसा संभव होता, तो सचमुच बड़े large language models की performance देखकर हमें इतना आश्चर्य नहीं होता
साथ ही, अगर आप संबंधित math पर reasoning नहीं कर सकते, तो यह समझना मुश्किल हो जाता है कि चीजें क्यों नहीं चल रहीं या कौन-से विकल्प उपलब्ध हैं। architecture, loss function, activation function, optimization technique, hyperparameters, training time और resources जैसे अनगिनत factors आपस में उलझे होते हैं
मुझे लगता है theory की value एक general conceptual framework देने में है। जैसे आज algorithms की asymptotic theory यह ठीक-ठीक नहीं बताती कि कौन-सा algorithm इस्तेमाल करना चाहिए, लेकिन broad direction जरूर देती है
reasonable regularization term को ध्यान में रखें तो overfitting का risk बहुत बड़ा नहीं होता, लेकिन दुख की बात है कि उस minimum value के लिए कोई rule नहीं है, इसलिए trial and error चाहिए। उल्टा, network को अंधाधुंध बड़ा करने से inefficiency आती है और आखिर में यह slow हो जाता है
activation function में output layer के लिए चुनाव आम तौर पर उस problem से तय होता है जिसे solve करना है, और internal layers के लिए आमतौर पर ReLU से शुरू करके problem के हिसाब से heuristics के आधार पर common variants आज़माए जाते हैं
similar problem में सफल रहे दूसरे model को starting point बनाना भी स्वाभाविक रूप से consider करना चाहिए
सचमुच साफ-सुथरा है। Tom Yeh की AI By Hand exercises याद आ गईं: https://www.byhand.ai/
material खुद उन लोगों के लिए शानदार है जिन्हें यह विषय पहले से आता है
साफ-सुथरा दिखता है। बस अफसोस यह है कि solution problem के तुरंत बाद है, इसलिए खुद सोचने से पहले अगली problem का जवाब पढ़े बिना रहना मुश्किल हो जाता है
सचमुच बढ़िया। मैं machine learning पर काम करता हूं, लेकिन math fundamentals, खासकर linear algebra और matrix/tensor operations को लेकर अब भी impostor syndrome है
deep learning fundamentals पर केंद्रित problem set resources और हों तो जानना चाहूंगा। रोज थोड़ा-थोड़ा खुद हाथ से करना, और कई teachers के नजरिए से सीखना—मेरे लिए यही तरीका सबसे अच्छा काम करता है
अभी “useful” machine learning बना रहे industry practitioners में से कितने लोग इन problems में से कुछ solve कर पाएंगे? और क्या उन्हें कर पाना चाहिए?
ऐसी exercises उस mathematical maturity के लिए useful हैं जो नए algorithms या low-level optimizations विकसित करने के लिए जरूरी intuition तक ले जाती है
मौजूदा machine learning algorithms को train करके deploy कर इस्तेमाल करने के typical case में इसकी जरूरत नहीं है
दोनों approaches contribute कर सकती हैं और success तक ले जा सकती हैं, लेकिन उनका तरीका अलग है
document को skim करने पर लगभग सब पहचान लिया, लेकिन context के बिना पूछा जाए तो शायद कई topics याद न आ पाएं। कभी शायद आ जाते
जानना चाहता हूं कि लोग ऐसी चीजें कितनी याद रखते हैं। समझ नहीं आता कि मैं math में मूल रूप से कमजोर कोई impostor हूं, या नियमित रूप से इस्तेमाल न करें तो समय के साथ भूल जाना स्वाभाविक है
solutions तक शामिल हैं, इसलिए खूबसूरत है। दूसरे topics पर भी ऐसी pen-and-paper exercises और हों तो रुचि होगी
अन्य math-oriented puzzles के लिए “The colossal book of short puzzles and problems” और “The art and craft of problem solving” देखें
पहले चर्चा हो चुकी है: Machine learning में pen and paper exercises (2021) - https://news.ycombinator.com/item?id=31913057 - जून 2022, 55 comments
यह मजेदार है कि mathematicians हमेशा linear algebra और matrix theory को machine learning में चुपके से घुसाने की कोशिश करते रहते हैं। अगर किसी को पता न हो, तो लगेगा कि academia ने large language models invent किए और वही consult किए जाने लायक experts हैं
बल्कि मेरे हिसाब से academia और theorists ने machine learning को slow किया, और computational techniques को इतना low-grade समझा कि कई पीढ़ियों के graduate students पर इसी example जैसी symbolic proofs थोपते रहे
linear algebra में proficient न होते हुए भी contribute कर रहा कौन है?
और आप पूरी field को large language models तक क्यों summarize कर रहे हैं, यह भी समझ नहीं आता
क्या arXiv research-level papers के लिए नहीं है? हैरानी है कि ऐसा material वहां uploaded है