चार nonzero parameters से हाथी fit करना
(arxiv.org)- 1953 में Enrico Fermi ने Johnny von Neumann के शब्दों को उद्धृत करते हुए Freeman Dyson के model की आलोचना की थी; वहीं से “चार parameters से हाथी fit करना” वाली समस्या शुरू हुई
- इस quote का इस्तेमाल इस आलोचना के लिए हुआ कि parameters बढ़ने पर model data से अच्छा fit होता दिख सकता है, लेकिन इससे physical meaning की गारंटी नहीं मिलती
- पिछली कोशिशें शर्तों को पूरी तरह पूरा नहीं कर पाईं: Wei ने 20 से ज़्यादा parameters इस्तेमाल किए, और Mayer et al. ने चार complex numbers दिखाए, लेकिन वे असल में 8 parameters के बराबर थे
- Paintadosi का one-parameter तरीका किसी भी shape को draw कर सकता है, लेकिन वह shape को बहुत लंबी real-number precision में encode करता है, इसलिए यह इस समस्या की भावना से मेल नहीं खाता
- यह लेख इस सीमा की ओर इशारा करता है कि समस्या खुद पर्याप्त रूप से defined नहीं थी, और दिए गए conditions में सिर्फ चार nonzero parameters से elephant curve fit करने की कोशिश है
Fermi की आलोचना से शुरू हुई समस्या
- 1953 में Enrico Fermi ने Dyson के model की आलोचना करते हुए Johnny von Neumann को quote किया
- “With four parameters I can fit an elephant, and with five I can make him wiggle his trunk.”
- इस कथन का अर्थ यह था कि भले ही कोई model complex हो और data से अच्छी तरह fit हो, अगर यह सिर्फ parameters की संख्या बढ़ाने का नतीजा है, तो वास्तविक physical meaning की गारंटी देना मुश्किल है
- मुख्य सवाल यह है कि क्या सच में सिर्फ चार parameters से हाथी fit किया जा सकता है
मौजूदा solutions कहां requirements से चूकते हैं
- Wei ने Fourier series से हाथी fit करने की कोशिश की, लेकिन ठीक-ठाक result पाने के लिए 20 से ज़्यादा parameters की जरूरत पड़ी
- result के बारे में आंका गया कि वह “तीसरी कक्षा के art teacher” को भी शायद संतुष्ट न करे
- Mayer et al. ने चार complex numbers से हाथी fit किया
- complex number में real part और imaginary part होते हैं, इसलिए असल में यह 8 parameters इस्तेमाल करने जैसा है
- अगर zero parameters भी गिने जाएं, तो कुल 20 हो जाते हैं
- resulting image को Picasso जैसी style में सुंदर माना गया
- Paintadosi ने दावा किया कि एक ही parameter पर्याप्त है, और एक parameter से कोई भी shape draw कर सकने वाला function बनाया
- लेकिन यह shape को सैकड़ों या हजारों digits की precision वाले एक real number में map करने वाली encoding के ज्यादा करीब है, इसलिए इस समस्या में इसे valid solution मानना मुश्किल है
- उस काम का focus यह दिखाना था कि parameter count model complexity का measure होने में fail हो सकता है
- यह paper पहले problem conditions को व्यवस्थित करता है, फिर पिछली कोशिशों से अलग चार nonzero parameters से हाथी fit करने का तरीका प्रस्तुत करता है
1 टिप्पणियां
Hacker News की टिप्पणियाँ
मुझे लेख का विडंबनापूर्ण पक्ष पसंद आया। यह भी जोड़ना अच्छा होता कि Fermi और von Neumann ने ऐसा क्यों कहा था
भौतिकी में जब वास्तविकता का मॉडल बनाया जाता है, तो अगर वह प्रयोग से मेल नहीं खाता, तो एक-एक करके parameters जोड़कर डेटा से fit नहीं करना चाहिए। आदर्श रूप से parameters 0 होने चाहिए या कम-से-कम होने चाहिए, और उससे भी गहराई में, parameters सरल मान्यताओं से स्वाभाविक रूप से निकलने चाहिए। अगर parameters 4 हों, तो यह समझना मुश्किल होता है कि मॉडल ने वास्तव में वास्तविकता के किसी पहलू को पकड़ा है या बस प्रयोगात्मक डेटा को fit किया है
फिर भी, उस सूक्ति की बुद्धिमत्ता कई क्षेत्रों में काफ़ी भुला दी गई लगती है। कई क्षेत्रों में डेटा को दर्जनों parameters वाले विशाल regression models, या अरबों parameters वाले neural networks से “model” किया जाता है
मेरे हिसाब से भौतिकी वहाँ से शुरू होती है जहाँ कम-से-कम एक natural constant हो, जैसे वास्तविक space की curvature या gravitational acceleration, जिसे मापना पड़ता है
उन्होंने recorded potential और injected current के लिए curve fitting से कई parameters निकाले, और बहुत बाद में पता चला कि वे sodium channels से मेल खाते हैं। इसी तरह अन्य processes potassium channels से मेल खाती थीं। अगर model को 3 parameters से समझाया नहीं जा सकता, तो कई parameters, यहाँ तक कि 4 भी, होने पर ज़्यादा चिंता की बात नहीं लगती
यह लेख मज़ेदार है और अच्छी तरह लिखा गया है, लेकिन मुझे लगता है कि यह उससे बढ़कर है
ML/AI को अक्सर curve fitting भर कहकर मज़ाक या टिप्पणी की जाती है। सिर्फ़ “curve fitting” से क्या कोई बुद्धिमान चीज़ निकल सकती है, इसका जवाब अभी नहीं है, और इसकी बड़ी वजह यह है कि “बुद्धिमान” का मतलब हर व्यक्ति के लिए अलग है
यहाँ बहुत साफ़ और आसानी से समझ आने वाला curve fitting दिखाया गया है, लेकिन मूल रूप से यह वही प्रक्रिया है। आप एक लक्ष्य तय करते हैं, loss function पर optimize करते हैं, और आशा करते हैं कि वह generalize करेगा। बेशक, यह elephant generalize नहीं करता, लेकिन प्यारा ज़रूर है
इसलिए हम फिर von Neumann के सवाल पर लौटते हैं: इतने सारे parameters की ज़रूरत क्यों है? विडंबना यह है कि हाल के समय में parameters की बहुत बड़ी संख्या से बहुत कुछ हासिल किया गया है, इसलिए जवाब कुछ ऐसा बन गया है: “बहुत सारे parameters से शानदार चीज़ें की जा सकती हैं”
मौजूदा LLMs सिर्फ़ मानव अनुभव पर सवार हैं; उन्होंने अपना अनुभव बनाने में बहुत कम भाग लिया है। इसलिए उन्हें imitation learning या तोता कह दिया जाता है। लेकिन अगर models ज़्यादा agent-जैसे बनें, तो वे अपने लिए उपयोगी अनुभव बना सकते हैं, और AlphaZero ने यह दिखाया है
Freeman Dyson ने Web of Life इंटरव्यू में उस किस्से को याद किया जिसने इस पेपर को प्रेरित किया। elephant fitting वाले हिस्से पर सीधे जाने वाला लिंक भी है
[1] https://youtu.be/hV41QEKiMlM
[2] https://youtu.be/hV41QEKiMlM?t=118
एक parameter काफ़ी है: https://aip.scitation.org/doi/10.1063/1.5031956
अफ़सोस की बात है कि पेपर में constant term, यानी औसत r_0, स्पष्ट रूप से नहीं दिया गया है। यह लगभग 180 के आसपास लगता है, लेकिन image बनाने के लिए यह मान सही रखना पड़ता है, और इसे पाँचवाँ ज़रूरी parameter न मानने का कोई साफ़ तरीका नहीं दिखता
इसलिए यह कहना मुश्किल है कि लक्ष्य सच में हासिल हो गया। फिर भी, यह वाकई मज़ेदार था
यह Dyson की Web of Stories इंटरव्यू का एक शानदार हिस्सा था, और लेखकों की तरह यह मुझ पर भी असर कर गया।
यह उस समय की बात है जब Dyson, Paion की pseudoscalar theory पर प्रारंभिक नतीजे लेकर Fermi के पास गए थे। Fermi ने बहुत जल्दी पूरी बात खारिज कर दी, जो Dyson के लिए झटका था, लेकिन इससे उनका और समय बर्बाद होने से बच गया।
Fermi: जब आप सैद्धांतिक गणना करते हैं, तो आपके पास या तो एक स्पष्ट physical model होना चाहिए या एक rigorous mathematical foundation। आपके पास इनमें से कोई भी नहीं है। फिट करने के लिए आपने कितने free parameters इस्तेमाल किए?
Dyson: 4
Fermi: Johnny von Neumann हमेशा कहा करते थे, “4 parameters से आप एक हाथी को fit कर सकते हैं, और 5 से उसकी सूँड़ हिला सकते हैं।”
काश arXiv पर humor और ज़्यादा होता।
अगर मैं कंपनी के संसाधनों का इस्तेमाल किए बिना, अपने निजी समय में कोई खोज करूँ, तो उसे यथासंभव सबसे मज़ेदार तरीके से प्रकाशित करूँगा।
कुछ सूचियाँ:
https://academia.stackexchange.com/questions/86346/is-it-ok-...
https://www.ellipsix.net/arxiv-joke-papers.html
https://arxiv.org/abs/2309.08632
Dr. Octave Levenspiel का ज़िक्र भी ज़रूरी है। मेरे undergraduate दिनों में वे professor emeritus थे, और industrial fluidized bed सहित कई क्षेत्रों में उन्होंने बहुत काम किया था।
हाथी वाले curve की चर्चा उस समय heterogeneous catalytic reactions में complex multi-parameter fitting की आलोचना के संदर्भ में थी। https://levenspiel.com/elephants/
वे कुछ समय तक डायनासोर की उड़ान पर एक aerodynamics paper प्रकाशित करने की कोशिश भी करते रहे। http://levenspiel.com/wp-content/uploads/2016/02/DinosaurW.p...
इस तरह की बौद्धिक जिज्ञासा थोड़ी Feynman की plate-spinning की याद दिलाती है।
D’Arcy Thompson की On Growth and Form का ज़िक्र क्यों नहीं है? जीवों पर उनका parameter model काफ़ी शानदार था, भले ही बहुत simple था।
https://en.wikipedia.org/wiki/On_Growth_and_Form
मेरी समझ के मुताबिक, real parameters की Fourier series
r(theta) = sum(r_k cos(k theta))केवल ऐसे “लहरदार वृत्त” जैसे आकार बना सकती है जिनमें origin से निकलने वाली हर radial ray पर सिर्फ़ एक बिंदु हो।complex parameters
z(theta) = sum(e^(z_ theta))ज़्यादा टेढ़े-मेढ़े shapes, यानी teapot, बना सकते हैं। ड्रॉ करने वाला arm घूमते समय pen को पीछे भी ले जा सकता है, और हर parameter पिछले parameter से निकाले गए बिंदु के आसपास के छोटे वृत्त पर कहीं भी उस बिंदु को ले जा सकता है।ज़रूरी 3B1B वीडियो: https://m.youtube.com/watch?v=r6sGWTCMz2k
एक complex parameter, 2 real parameters के बराबर होता है, इसलिए सबसे अच्छे 4 cosine curves की तुलना सबसे अच्छे 2 complex exponential curves से करनी चाहिए।