No Free Lunch theorem का ज़िक्र करते समय यह caveat भी जोड़ना चाहिए कि व्यवहार में यह उतनी बड़ी रुकावट नहीं है
सिर्फ़ यह मान लेना कि डेटा वास्तविक दुनिया से आता है, इस theorem को बाधा न बनने देने के लिए काफ़ी है
यह किताब इस बात को बिल्कुल नहीं छूती; अच्छा होता अगर यह समझाती कि यहाँ “सभी distributions” कुछ ऐसा है जैसे सिक्का उछालकर बनने वाली सभी संभावित bit strings को discontinuous functions के high-dimensional space में generalize करना, और continuous functions उसका बस बहुत छोटा subset हैं
अंत में इसका मतलब कुछ ऐसा है कि अगर डेटा “सभी संभावनाओं” के uniform random distribution से आता है, तो अगले coin toss का नतीजा जैसी चीज़ सीखी और predict नहीं की जा सकती
सही है। इस तरह के No Free Lunch theorem या बहुत ज़्यादा general assumptions वाले results आम तौर पर बहुत pessimistic दिखते हैं
उदाहरण के लिए कई लोग halting problem या Rice theorem की वजह से भोलेपन में सोच लेते हैं कि static program analysis असंभव है
यह Hume की problem of induction जैसा है। assumptions के बिना पिछले observations को future predictions से जोड़ा नहीं जा सकता
सूरज हज़ार सुबह उगा है, इससे अपने-आप यह संभावना न बढ़ती है न घटती कि वह कल भी उगेगा; हमें कुछ ऐसा assumption रखना पड़ता है कि समय बीतने पर घटनाएँ आम तौर पर मिलती-जुलती तरह से आगे बढ़ती हैं
ऐसा assumption डेटा से निकाला नहीं जा सकता। अतीत में चीज़ें मिलती-जुलती चली हों, तब भी वह भविष्य के बारे में कुछ नहीं बताता
फिर भी science इस समस्या के बावजूद ठीक चलती है, और machine learning भी इसलिए ठीक काम करती रहती है क्योंकि लोग algorithms design करते समय अनुभव और prior knowledge इस्तेमाल करते हैं
इन assumptions को inductive bias कहा जाता है, और ये learning को “करीब की चीज़ें आम तौर पर मिलती-जुलती होती हैं” जैसे खास patterns की तरफ़ झुका देते हैं
मुझे ठीक से समझ नहीं आ रहा कि वह caveat कैसे लागू होता है। No Free Lunch theorem का मतलब यह नहीं कि कुछ problems सीखना असंभव है, बल्कि मेरी समझ में इसका मतलब है कि सभी problem classes पर अच्छा काम करने वाला कोई single algorithm नहीं है
proof में आने वाले examples बनावटी हो सकते हैं, लेकिन असल में अतिरिक्त assumptions के आधार पर अलग algorithm चुना जाता है, है न?
learning theory प्राकृतिक विज्ञान को decision-making तक formalize करने की कोशिश है। प्राकृतिक विज्ञान का छिपा assumption यह है कि पर्याप्त refined algorithmic world model से past observations के आधार पर future observations predict किए जा सकते हैं
यह वही assumption है जो Solomonoff ने inductive inference prove करते समय रखा था, इसलिए शुरुआत Rissanen की तथाकथित “universal” coding से नहीं बल्कि Turing-complete coding से होनी चाहिए
sub-theory बनाते समय उस starting point से हटना ठीक है, लेकिन अगर वहीं से शुरुआत न की जाए तो पिछले 50 सालों में “minimum description length principle” का सही मतलब क्या है, इस पर भ्रम जैसे बेकार नतीजों तक बात पहुँचती है
हालांकि अगर causal model बनाने की कोशिश हो, तो यह ठीक नहीं है। dynamical systems को model करने के लिए Turing-complete code से हट नहीं सकते
dynamical system को बहुत सारे states वाली finite-state machine के रूप में देखा जा सकता है, लेकिन optimally compressed code बनाने के लिए बहुत बड़ी लेकिन finite संख्या में flip-flops या NOR, NAND जैसे universal gates के directed cyclic graph पर चलने वाली Turing-complete semantics चाहिए
double descent की वजह अब पता चल गई है क्या?
पता नहीं यह generalized result है या नहीं, लेकिन Anthropic की Circuits team ने काफ़ी convincing hypothesis दिया है। पहला descent phase वह है जहाँ model data points याद करता है, और दूसरा descent phase वह है जहाँ वह geometrically features सीखने की ओर shift करता है
यहाँ features को abstract और बहुत high-dimensional vector space माना जा सकता है
यह team एक neuron द्वारा कई concepts encode करने वाले superposition idea की गहराई से जाँच कर रही है
वे latent features को explicitly represent करके उन्हें छोटे data dimensions के set में compress करने वाले toy models और datasets पर experiment करते हैं, superposition को force करके बनाते हैं, और दिखाते हैं कि training data size के हिसाब से वह superposition कैसी दिखती है
साफ़ तौर पर यह toy model है, लेकिन कम-से-कम superposition झेलने वाले models के लिए यह एक convincing idea है https://transformer-circuits.pub/2023/toy-double-descent/ind...
मैं expert नहीं हूँ, लेकिन यह paper एक simple model से double descent explore करता है
interpretation यह है: overparameterized region में expand करने पर छोटे norm वाले weights की तरफ़ optimize किया जा सकता है, और ऐसे weights फिर अच्छी तरह generalize करते हैं
क्या यह double descent को generally समझाता है, या deep neural networks जैसे दूसरे models पर भी लागू होता है, यह अलग सवाल है https://arxiv.org/pdf/2303.14151.pdf
अभी पता नहीं। मेरी निजी पसंदीदा hypothesis यह है कि stochastic gradient descent सचमुच stochastic है
यह पूरे training corpus पर नहीं, बल्कि बहुत छोटे subset पर optimize करता है, इसलिए gradient exact नहीं होता
विचार यह है कि excessive training local optimum को push करती है और local overfitting basins को bypass करने के बजाय recursively वास्तविक distribution की तरफ़ बढ़ने देती है
इंटरनेट पर academia, educators और engineers द्वारा लिखी गई शानदार math PDFs सचमुच बहुत बड़ी संख्या में free उपलब्ध हैं। समस्या यह है कि content duplication भी बहुत ज़्यादा है
सोचता हूँ कि क्या ऐसा AI model बनाया जा सकता है जो overlapping materials के bundle को बिना duplication के, coherent एक PDF में अच्छी तरह synthesize कर दे
शायद बस उस university lecture में इस्तेमाल होने वाली book चुन लेना ही काफ़ी हो
AI model की भी ज़रूरत नहीं। Murphy की Probabilistic Machine Learning एक बेहतरीन reference book और resource है
छोटी-सी nitpick है, लेकिन title confusing है। पहला शब्द Machine-Learning या Statistical-Learning कर देना बेहतर होगा
मुमकिन हो तो उम्मीद है author कभी इसे ऐसा बदल देंगे
पढ़ना काफ़ी कठिन है। उदाहरण के लिए, अध्याय 1 के पहले पेज पर quadratic form को minimize करने की बात की गई है और linear least squares formula जैसा कुछ दिखाया गया है, लेकिन वह सही है या नहीं, इसकी कोई व्याख्या नहीं है
थोड़ा और explanation हो तो मदद मिलेगी
यह बात पसंद आई कि exercises बहुत हैं
यह लेख शायद उन लोगों के लिए है जिनके पास कुछ हद तक mathematics background है और जो learning theory समझना चाहते हैं
ऊपर से उस chapter को साफ़ तौर पर review लिखा गया है, यानी माना गया है कि वह सामग्री कहीं और पहले से सीखी जा चुकी है या सीखी जाएगी
first principles से शुरू करने का मतलब यह नहीं कि पढ़ना आसान होगा
sibling comment की तरह, यह साफ़ है कि यह सामग्री पहली बार सीखने वालों के लिए नहीं है
फिर भी intuition सही है। ordinary least squares method का objective function लिखें तो वह quadratic form बन जाता है
यहाँ “quadratic” शब्द का चुनाव संयोग नहीं है; यह quadratic function को matrices में generalize करने जैसा है
वह section quadratic function को minimize करने के vector version से जुड़ा है
वाकई ऐसा नहीं लगता कि यह first principles से शुरू कर रहा है
least squares method एक quadratic expression है
quadratic का मतलब है कि उसमें squared term है
2014 में आई machine learning की किताब—अब तो कुछ vintage और historical जैसी लगती है
उस दिन का इंतज़ार है जब GPT-5 से कह सकूँगा, “मेरे पास एक idea है जिसे try करना चाहता हूँ; यह किताब पढ़कर बताओ कि उसमें ऐसा कुछ है क्या जो इसे बेहतर काम करने में मदद करे”
मैंने कभी नहीं सुना कि किसी LLM ने कोई नया idea बनाया हो। क्या यह तभी संभव नहीं है जब वह idea पहले किसी ने try किया हो?
मुझे एहसास हो रहा है कि $this के बारे में context पहुँचाना ही कठिन हिस्सा है
user के रूप में मेरे context को कुछ low-dimensional variables में समझाना बहुत मुश्किल है, और मैं खुद भी universe में अपनी स्थिति को AI को समझाने लायक नहीं समझता
AI के साथ साझा vocabulary भी कम है। Internet ने HTTP नाम के साझा protocol के ज़रिए agreed state को consistent तरीके से आगे-पीछे भेजने में सफलता पाई है, ऐसा लगता है
उदाहरण के लिए Uber के अंदर phone number, car, GPS, current time, payment जैसी narrow request-response दुनिया में state भेजी जा सकती है
लेकिन algorithms सीखने वाले student के तौर पर मेरी उम्र, internet use environment, रहने की जगह, graphical explanations की preference, मोटी किताबों से डरने का history, CS50 जैसे milestones, Python proficiency जैसी complex जानकारी कैसे pass करूँ, यह समझ नहीं आता
startup idea के लिए भी सिर्फ़ “traction कम है” कहना काफ़ी नहीं; VC, developers, sales network, successful partnerships के evidence, attendee count, revenue जैसी state convey करनी होगी
real world में भी हर किसी का context इतना अलग है कि ऐसी vocabulary सिर्फ़ छोटे-छोटे pockets में ही मौजूद है
यह मान लेना भी problem है कि knowledge किसी global और eternal variable की तरह मौजूद है। कुछ क्षेत्रों में बिजली भी नहीं है और basic mobile phone तक नहीं रखने वाले लोग बहुत हैं, इसलिए AI द्वारा recommend किया गया PDF मदद करेगा या नहीं, यह भी local power structure और governance पर निर्भर करता है
आगे यह कैसे evolve होगा, पता नहीं, लेकिन possibilities के बारे में सोचना ही दिलचस्प है। Computers हमसे आसानी से बात कर सकते हैं और पहले दिन से ही smart baby जैसे हैं, लेकिन आखिरकार पर्याप्त, सही और सस्ता data न डाल पाना ही शायद उनकी usefulness को और आगे बढ़ाने का असली bottleneck हो
अगर आप वह किताब खुद पढ़ेंगे तो idea बेहतर होगा। उस process में कुछ नया सीखने को भी मिल सकता है
1 टिप्पणियां
Hacker News की राय
No Free Lunch theorem का ज़िक्र करते समय यह caveat भी जोड़ना चाहिए कि व्यवहार में यह उतनी बड़ी रुकावट नहीं है
सिर्फ़ यह मान लेना कि डेटा वास्तविक दुनिया से आता है, इस theorem को बाधा न बनने देने के लिए काफ़ी है
यह किताब इस बात को बिल्कुल नहीं छूती; अच्छा होता अगर यह समझाती कि यहाँ “सभी distributions” कुछ ऐसा है जैसे सिक्का उछालकर बनने वाली सभी संभावित bit strings को discontinuous functions के high-dimensional space में generalize करना, और continuous functions उसका बस बहुत छोटा subset हैं
अंत में इसका मतलब कुछ ऐसा है कि अगर डेटा “सभी संभावनाओं” के uniform random distribution से आता है, तो अगले coin toss का नतीजा जैसी चीज़ सीखी और predict नहीं की जा सकती
उदाहरण के लिए कई लोग halting problem या Rice theorem की वजह से भोलेपन में सोच लेते हैं कि static program analysis असंभव है
सूरज हज़ार सुबह उगा है, इससे अपने-आप यह संभावना न बढ़ती है न घटती कि वह कल भी उगेगा; हमें कुछ ऐसा assumption रखना पड़ता है कि समय बीतने पर घटनाएँ आम तौर पर मिलती-जुलती तरह से आगे बढ़ती हैं
ऐसा assumption डेटा से निकाला नहीं जा सकता। अतीत में चीज़ें मिलती-जुलती चली हों, तब भी वह भविष्य के बारे में कुछ नहीं बताता
फिर भी science इस समस्या के बावजूद ठीक चलती है, और machine learning भी इसलिए ठीक काम करती रहती है क्योंकि लोग algorithms design करते समय अनुभव और prior knowledge इस्तेमाल करते हैं
इन assumptions को inductive bias कहा जाता है, और ये learning को “करीब की चीज़ें आम तौर पर मिलती-जुलती होती हैं” जैसे खास patterns की तरफ़ झुका देते हैं
proof में आने वाले examples बनावटी हो सकते हैं, लेकिन असल में अतिरिक्त assumptions के आधार पर अलग algorithm चुना जाता है, है न?
learning theory प्राकृतिक विज्ञान को decision-making तक formalize करने की कोशिश है। प्राकृतिक विज्ञान का छिपा assumption यह है कि पर्याप्त refined algorithmic world model से past observations के आधार पर future observations predict किए जा सकते हैं
यह वही assumption है जो Solomonoff ने inductive inference prove करते समय रखा था, इसलिए शुरुआत Rissanen की तथाकथित “universal” coding से नहीं बल्कि Turing-complete coding से होनी चाहिए
sub-theory बनाते समय उस starting point से हटना ठीक है, लेकिन अगर वहीं से शुरुआत न की जाए तो पिछले 50 सालों में “minimum description length principle” का सही मतलब क्या है, इस पर भ्रम जैसे बेकार नतीजों तक बात पहुँचती है
हालांकि अगर causal model बनाने की कोशिश हो, तो यह ठीक नहीं है। dynamical systems को model करने के लिए Turing-complete code से हट नहीं सकते
dynamical system को बहुत सारे states वाली finite-state machine के रूप में देखा जा सकता है, लेकिन optimally compressed code बनाने के लिए बहुत बड़ी लेकिन finite संख्या में flip-flops या NOR, NAND जैसे universal gates के directed cyclic graph पर चलने वाली Turing-complete semantics चाहिए
double descent की वजह अब पता चल गई है क्या?
यहाँ features को abstract और बहुत high-dimensional vector space माना जा सकता है
यह team एक neuron द्वारा कई concepts encode करने वाले superposition idea की गहराई से जाँच कर रही है
वे latent features को explicitly represent करके उन्हें छोटे data dimensions के set में compress करने वाले toy models और datasets पर experiment करते हैं, superposition को force करके बनाते हैं, और दिखाते हैं कि training data size के हिसाब से वह superposition कैसी दिखती है
साफ़ तौर पर यह toy model है, लेकिन कम-से-कम superposition झेलने वाले models के लिए यह एक convincing idea है
https://transformer-circuits.pub/2023/toy-double-descent/ind...
और detail यहाँ है: https://calculatedcontent.com/2019/12/03/towards-a-new-theor...
interpretation यह है: overparameterized region में expand करने पर छोटे norm वाले weights की तरफ़ optimize किया जा सकता है, और ऐसे weights फिर अच्छी तरह generalize करते हैं
क्या यह double descent को generally समझाता है, या deep neural networks जैसे दूसरे models पर भी लागू होता है, यह अलग सवाल है
https://arxiv.org/pdf/2303.14151.pdf
यह पूरे training corpus पर नहीं, बल्कि बहुत छोटे subset पर optimize करता है, इसलिए gradient exact नहीं होता
विचार यह है कि excessive training local optimum को push करती है और local overfitting basins को bypass करने के बजाय recursively वास्तविक distribution की तरफ़ बढ़ने देती है
इंटरनेट पर academia, educators और engineers द्वारा लिखी गई शानदार math PDFs सचमुच बहुत बड़ी संख्या में free उपलब्ध हैं। समस्या यह है कि content duplication भी बहुत ज़्यादा है
सोचता हूँ कि क्या ऐसा AI model बनाया जा सकता है जो overlapping materials के bundle को बिना duplication के, coherent एक PDF में अच्छी तरह synthesize कर दे
छोटी-सी nitpick है, लेकिन title confusing है। पहला शब्द Machine-Learning या Statistical-Learning कर देना बेहतर होगा
मुमकिन हो तो उम्मीद है author कभी इसे ऐसा बदल देंगे
पढ़ना काफ़ी कठिन है। उदाहरण के लिए, अध्याय 1 के पहले पेज पर quadratic form को minimize करने की बात की गई है और linear least squares formula जैसा कुछ दिखाया गया है, लेकिन वह सही है या नहीं, इसकी कोई व्याख्या नहीं है
थोड़ा और explanation हो तो मदद मिलेगी
यह बात पसंद आई कि exercises बहुत हैं
ऊपर से उस chapter को साफ़ तौर पर review लिखा गया है, यानी माना गया है कि वह सामग्री कहीं और पहले से सीखी जा चुकी है या सीखी जाएगी
फिर भी intuition सही है। ordinary least squares method का objective function लिखें तो वह quadratic form बन जाता है
यहाँ “quadratic” शब्द का चुनाव संयोग नहीं है; यह quadratic function को matrices में generalize करने जैसा है
वह section quadratic function को minimize करने के vector version से जुड़ा है
quadratic का मतलब है कि उसमें squared term है
दिलचस्प है। इस विषय पर कोई अच्छी किताब है?
दिलचस्प। समय ज़्यादा मिलने पर इसे सरसरी तौर पर देखना चाहूँगा
जल्दी से देखने पर लगता है कि यह किताब [1] के साथ काफ़ी content overlap करती है। जानना चाहूँगा कि दोनों में फर्क क्या है
[1]: https://www.cambridge.org/core/books/understanding-machine-l...
उस दिन का इंतज़ार है जब GPT-5 से कह सकूँगा, “मेरे पास एक idea है जिसे try करना चाहता हूँ; यह किताब पढ़कर बताओ कि उसमें ऐसा कुछ है क्या जो इसे बेहतर काम करने में मदद करे”
$thisके बारे में context पहुँचाना ही कठिन हिस्सा हैuser के रूप में मेरे context को कुछ low-dimensional variables में समझाना बहुत मुश्किल है, और मैं खुद भी universe में अपनी स्थिति को AI को समझाने लायक नहीं समझता
AI के साथ साझा vocabulary भी कम है। Internet ने HTTP नाम के साझा protocol के ज़रिए agreed state को consistent तरीके से आगे-पीछे भेजने में सफलता पाई है, ऐसा लगता है
उदाहरण के लिए Uber के अंदर phone number, car, GPS, current time, payment जैसी narrow request-response दुनिया में state भेजी जा सकती है
लेकिन algorithms सीखने वाले student के तौर पर मेरी उम्र, internet use environment, रहने की जगह, graphical explanations की preference, मोटी किताबों से डरने का history, CS50 जैसे milestones, Python proficiency जैसी complex जानकारी कैसे pass करूँ, यह समझ नहीं आता
startup idea के लिए भी सिर्फ़ “traction कम है” कहना काफ़ी नहीं; VC, developers, sales network, successful partnerships के evidence, attendee count, revenue जैसी state convey करनी होगी
real world में भी हर किसी का context इतना अलग है कि ऐसी vocabulary सिर्फ़ छोटे-छोटे pockets में ही मौजूद है
यह मान लेना भी problem है कि knowledge किसी global और eternal variable की तरह मौजूद है। कुछ क्षेत्रों में बिजली भी नहीं है और basic mobile phone तक नहीं रखने वाले लोग बहुत हैं, इसलिए AI द्वारा recommend किया गया PDF मदद करेगा या नहीं, यह भी local power structure और governance पर निर्भर करता है
आगे यह कैसे evolve होगा, पता नहीं, लेकिन possibilities के बारे में सोचना ही दिलचस्प है। Computers हमसे आसानी से बात कर सकते हैं और पहले दिन से ही smart baby जैसे हैं, लेकिन आखिरकार पर्याप्त, सही और सस्ता data न डाल पाना ही शायद उनकी usefulness को और आगे बढ़ाने का असली bottleneck हो