4 पॉइंट द्वारा GN⁺ 2025-03-22 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Pen & Paper उन पाठकों के लिए मशीन लर्निंग के विस्तृत व्याख्यात्मक अभ्यास प्रश्नों का संग्रह है, जो पहले से सिद्धांत और अवधारणाओं से परिचित हैं और प्रश्न हल करके अपनी समझ को गहरा करना चाहते हैं
  • जब किताबों और लेक्चरों में अभ्यास प्रश्नों के हल बहुत छोटे हों या बिल्कुल न हों, तो सीखने का अवसर आसानी से हताशा में बदल सकता है; इसलिए इसका लक्ष्य ऐसा विस्तृत समाधान स्तर देना है, जिसे चरण-दर-चरण फॉलो किया जा सके
  • कोडिंग और simulation भी महत्वपूर्ण हैं, लेकिन अधिकांश प्रश्नों को पेन और कागज़ से हल करने लायक बनाया गया है, ताकि गणितीय सोच को मजबूत करने पर फोकस रहे
  • प्रश्न मुख्य रूप से University of Helsinki के “Unsupervised Machine Learning” और University of Edinburgh के “Probabilistic Modelling and Reasoning” लेक्चरों के प्रश्नों को मिलाकर बनाए गए हैं, और इसका दायरा unsupervised methods, inference, और learning पर केंद्रित है
  • Michael Gutmann चाहते हैं कि यह प्रश्न-संग्रह लगातार बढ़ता रहे, और इसके लिए LaTeX source को सार्वजनिक किया गया है, GitHub issue के ज़रिये त्रुटि रिपोर्ट करने और बड़े योगदान के लिए सीधे संपर्क करने का मार्ग बताया गया है

अभ्यास प्रश्नों से समझ को गहरा करने वाली किताब

  • use it or lose it” वाली कहावत की तरह, किसी skill का अभ्यास न किया जाए तो वह कमजोर पड़ जाती है, और नई skills सीखते समय भी बार-बार उनका उपयोग करना ज़रूरी होता है
  • कई किताबें और lecture अभ्यास प्रश्न देते हैं, लेकिन जब उनके समाधान बहुत छोटे हों या न हों, तो प्रश्न हल करना हताशा का कारण बन सकता है और लोग उन्हें छोड़ देते हैं
  • यह किताब विस्तृत हलों के साथ अभ्यास प्रश्नों का संग्रह है
    • इसका लक्ष्य इतना विस्तार देना है कि पाठक समाधान को फॉलो करते हुए इस्तेमाल की गई techniques को समझ सकें
    • यह मशीन लर्निंग की किताबों या lectures का विकल्प नहीं है
    • यह उन स्थितियों के लिए बनाई गई है जहाँ पाठक संबंधित सिद्धांत और अवधारणाएँ पहले देख चुके हों और अब प्रश्न हल करके समझ को मजबूत करना चाहते हों

पेन और कागज़ केंद्रित संरचना

  • मशीन लर्निंग में coding और computer simulation बहुत महत्वपूर्ण हैं
  • लेकिन इस किताब के अधिकांश प्रश्न पेन और कागज़ से हल किए जा सकते हैं
    • पेन और कागज़ पर आधारित यह संरचना सामग्री को संक्षिप्त रखती है और व्याख्या को सरल बनाती है
    • इससे गणितीय क्षमता को मजबूत करने में मदद मिलती है
  • अगर इसे computer practice के साथ इस्तेमाल किया जाए, तो अवधारणाओं की समझ और गहरी हो सकती है

शामिल विषय और दायरा

  • प्रश्न मुख्य रूप से दो courses में विकसित सामग्री को मिलाकर बनाए गए हैं
    • University of Helsinki का “Unsupervised Machine Learning
    • University of Edinburgh का “Probabilistic Modelling and Reasoning
  • यह मशीन लर्निंग के पूरे क्षेत्र को कवर नहीं करता
  • इसका फोकस unsupervised methods, inference, और learning पर स्पष्ट रूप से है
  • दिए गए पाठ में Chapter 1 Linear Algebra के उदाहरण के रूप में Gram–Schmidt orthogonalization का एक प्रश्न शामिल है
    • दो vectors से बने u1, u2 के एक-दूसरे के orthogonal होने की पुष्टि inner product से की जाती है
    • यदि a2, a1 का multiple हो, तो orthogonalization प्रक्रिया में u2 zero vector बन जाता है
    • यह दिखाया जाता है कि linearly independent a1, a2 के किसी भी linear combination को u1, u2 के रूप में फिर से लिखा जा सकता है

विस्तार और योगदान का तरीका

  • लक्ष्य यह है कि समय के साथ नए प्रश्न जोड़कर यह प्रश्न-संग्रह और बड़ा होता जाए
  • LaTeX source code GitHub repository में सार्वजनिक रूप से उपलब्ध है
  • गलतियाँ या टाइपो GitHub issue के माध्यम से रिपोर्ट की जा सकती हैं
  • बड़े योगदान के लिए सीधे संपर्क करने का तरीका भी बताया गया है

1 टिप्पणियां

 
GN⁺ 2025-03-22
Hacker News टिप्पणियां
  • देखने में शानदार है, लेकिन मशीन लर्निंग पढ़ते समय सबसे निराशाजनक बात यह है कि सिद्धांत में चाहे जितना गहराई तक जाएं, यह साफ़ नहीं दिखता कि वह वास्तविक choices से कैसे जुड़ता है
    उदाहरण के लिए, एक layer में neurons की संख्या, layers की संख्या, activation function, neural network इस्तेमाल करना है या कोई दूसरी technique—ऐसे फैसलों में theory कैसे मदद करती है, यह जानना चाहता हूं

    • मददगार हो सकता है: https://github.com/google-research/tuning_playbook
    • हर machine learning paper में layers में neurons की संख्या, layers की संख्या, activation function जैसी चीजों के लिए लगभग हमेशा बड़े पैमाने के ablation experiments जुड़े होते हैं; यह इस बात का संकेत ज्यादा है कि उस हिस्से के बारे में असल में किसी को पक्का नहीं पता
      बस इधर-उधर random चीजें आज़माकर जो काम करे उसे खोजते हैं, एक-दूसरे के ideas कॉपी करते हैं, और धीरे-धीरे धुंधले guidelines बन जाते हैं
      अगर आपको logical और explainable चीज चाहिए, तो यह लगभग सबसे खराब field है; ज्यादातर काम dataset को label करना, compute cost चुकाना, और उम्मीद करना कि सब ठीक चलेगा, यही है
    • ज्यादातर चीजें सिर्फ pure theory या सिर्फ pure practice से नहीं सीखी जा सकतीं, और modern work से जुड़ी लगभग हर चीज के साथ भी ऐसा ही है
      machine learning में हर चीज theory से derive नहीं की जा सकती। अगर ऐसा संभव होता, तो सचमुच बड़े large language models की performance देखकर हमें इतना आश्चर्य नहीं होता
      साथ ही, अगर आप संबंधित math पर reasoning नहीं कर सकते, तो यह समझना मुश्किल हो जाता है कि चीजें क्यों नहीं चल रहीं या कौन-से विकल्प उपलब्ध हैं। architecture, loss function, activation function, optimization technique, hyperparameters, training time और resources जैसे अनगिनत factors आपस में उलझे होते हैं
    • इस समय machine learning practice theory से बहुत आगे है। theory अगर catch up भी कर ले, तो भी जवाब data generate करने वाली प्रक्रिया की प्रकृति पर निर्भर होने की संभावना है, इसलिए अंततः जवाब empirical ही देना पड़ेगा
      मुझे लगता है theory की value एक general conceptual framework देने में है। जैसे आज algorithms की asymptotic theory यह ठीक-ठीक नहीं बताती कि कौन-सा algorithm इस्तेमाल करना चाहिए, लेकिन broad direction जरूर देती है
    • beginner के नजरिए से, Andrew Ng के Coursera course, खासकर neural networks वाले हिस्से से मुझे मिला मुख्य point यह था कि “न्यूनतम जरूरत” से ज्यादा neurons और layers डालना आम तौर पर ठीक रहता है
      reasonable regularization term को ध्यान में रखें तो overfitting का risk बहुत बड़ा नहीं होता, लेकिन दुख की बात है कि उस minimum value के लिए कोई rule नहीं है, इसलिए trial and error चाहिए। उल्टा, network को अंधाधुंध बड़ा करने से inefficiency आती है और आखिर में यह slow हो जाता है
      activation function में output layer के लिए चुनाव आम तौर पर उस problem से तय होता है जिसे solve करना है, और internal layers के लिए आमतौर पर ReLU से शुरू करके problem के हिसाब से heuristics के आधार पर common variants आज़माए जाते हैं
      similar problem में सफल रहे दूसरे model को starting point बनाना भी स्वाभाविक रूप से consider करना चाहिए
  • सचमुच साफ-सुथरा है। Tom Yeh की AI By Hand exercises याद आ गईं: https://www.byhand.ai/

    • मैं ऐसी ही चीज की उम्मीद कर रहा था, बहुत शुक्रिया। original article का paper भी अच्छा है, लेकिन लगता है वह उन लोगों को ही बेहतर समझ आता है जिन्हें content पहले से पता है
      material खुद उन लोगों के लिए शानदार है जिन्हें यह विषय पहले से आता है
  • साफ-सुथरा दिखता है। बस अफसोस यह है कि solution problem के तुरंत बाद है, इसलिए खुद सोचने से पहले अगली problem का जवाब पढ़े बिना रहना मुश्किल हो जाता है

  • सचमुच बढ़िया। मैं machine learning पर काम करता हूं, लेकिन math fundamentals, खासकर linear algebra और matrix/tensor operations को लेकर अब भी impostor syndrome है
    deep learning fundamentals पर केंद्रित problem set resources और हों तो जानना चाहूंगा। रोज थोड़ा-थोड़ा खुद हाथ से करना, और कई teachers के नजरिए से सीखना—मेरे लिए यही तरीका सबसे अच्छा काम करता है

  • अभी “useful” machine learning बना रहे industry practitioners में से कितने लोग इन problems में से कुछ solve कर पाएंगे? और क्या उन्हें कर पाना चाहिए?

    • मेरे हिसाब से नहीं। उन्हें ज़रूर solve कर पाना चाहिए या इसकी जरूरत है, ऐसा नहीं है
      ऐसी exercises उस mathematical maturity के लिए useful हैं जो नए algorithms या low-level optimizations विकसित करने के लिए जरूरी intuition तक ले जाती है
      मौजूदा machine learning algorithms को train करके deploy कर इस्तेमाल करने के typical case में इसकी जरूरत नहीं है
    • अच्छी खबर यह है कि अगर आपकी रुचि latest techniques को आगे बढ़ाने में नहीं है और आप बस API calls करना चाहते हैं, तो machine learning को गहराई से सीखने की जरूरत नहीं है
    • यह इस पर निर्भर करता है कि आप “machine learning practitioner”, “बनाना” और “machine learning” को कैसे define करते हैं। optimization section देखें तो कुछ लोग इसे बहुत अच्छी तरह समझते हैं, इसलिए वे possible loss functions, parameter update methods और कहाँ failure हो सकता है, इसे दिमाग में तेजी से iterate कर सकते हैं
    • कुछ लोग पढ़ाई को chore की तरह देखते हैं और काम पूरा करने के लिए जितना न्यूनतम सीखना जरूरी हो, बस उतना सीखना चाहते हैं। दूसरे लोग पढ़ाई से insight और मज़ा लेते हैं, और problems solve करना व materials पढ़ना enjoy करते हैं
      दोनों approaches contribute कर सकती हैं और success तक ले जा सकती हैं, लेकिन उनका तरीका अलग है
    • मुझे भी यही जानना है। कई साल machine learning engineer के रूप में काम किया है और इस field में कुछ degrees भी हैं
      document को skim करने पर लगभग सब पहचान लिया, लेकिन context के बिना पूछा जाए तो शायद कई topics याद न आ पाएं। कभी शायद आ जाते
      जानना चाहता हूं कि लोग ऐसी चीजें कितनी याद रखते हैं। समझ नहीं आता कि मैं math में मूल रूप से कमजोर कोई impostor हूं, या नियमित रूप से इस्तेमाल न करें तो समय के साथ भूल जाना स्वाभाविक है
  • solutions तक शामिल हैं, इसलिए खूबसूरत है। दूसरे topics पर भी ऐसी pen-and-paper exercises और हों तो रुचि होगी

    • पता नहीं आप किन दूसरे topics की बात कर रहे हैं, लेकिन “1000 exercises in probability” ही आपको काफी समय तक व्यस्त रखेगी। PDF online मिल सकती है
      अन्य math-oriented puzzles के लिए “The colossal book of short puzzles and problems” और “The art and craft of problem solving” देखें
  • पहले चर्चा हो चुकी है: Machine learning में pen and paper exercises (2021) - https://news.ycombinator.com/item?id=31913057 - जून 2022, 55 comments

  • यह मजेदार है कि mathematicians हमेशा linear algebra और matrix theory को machine learning में चुपके से घुसाने की कोशिश करते रहते हैं। अगर किसी को पता न हो, तो लगेगा कि academia ने large language models invent किए और वही consult किए जाने लायक experts हैं
    बल्कि मेरे हिसाब से academia और theorists ने machine learning को slow किया, और computational techniques को इतना low-grade समझा कि कई पीढ़ियों के graduate students पर इसी example जैसी symbolic proofs थोपते रहे

    • अगर आप सिर्फ existing techniques इस्तेमाल करने से आगे जाकर machine learning में contribute करना चाहते हैं, तो math capability सबसे बड़ा limiting factor है
      linear algebra में proficient न होते हुए भी contribute कर रहा कौन है?
      और आप पूरी field को large language models तक क्यों summarize कर रहे हैं, यह भी समझ नहीं आता
    • दिलचस्प perspective है। क्या आप कोई ऐसा resource recommend कर सकते हैं जो symbolic proofs की बजाय computational techniques को priority देता हो?
    • दिलचस्प है। क्या आप ऐसा कोई example share कर सकते हैं?
  • क्या arXiv research-level papers के लिए नहीं है? हैरानी है कि ऐसा material वहां uploaded है