1 पॉइंट द्वारा GN⁺ 2024-07-15 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • 1953 में Enrico Fermi ने Johnny von Neumann के शब्दों को उद्धृत करते हुए Freeman Dyson के model की आलोचना की थी; वहीं से “चार parameters से हाथी fit करना” वाली समस्या शुरू हुई
  • इस quote का इस्तेमाल इस आलोचना के लिए हुआ कि parameters बढ़ने पर model data से अच्छा fit होता दिख सकता है, लेकिन इससे physical meaning की गारंटी नहीं मिलती
  • पिछली कोशिशें शर्तों को पूरी तरह पूरा नहीं कर पाईं: Wei ने 20 से ज़्यादा parameters इस्तेमाल किए, और Mayer et al. ने चार complex numbers दिखाए, लेकिन वे असल में 8 parameters के बराबर थे
  • Paintadosi का one-parameter तरीका किसी भी shape को draw कर सकता है, लेकिन वह shape को बहुत लंबी real-number precision में encode करता है, इसलिए यह इस समस्या की भावना से मेल नहीं खाता
  • यह लेख इस सीमा की ओर इशारा करता है कि समस्या खुद पर्याप्त रूप से defined नहीं थी, और दिए गए conditions में सिर्फ चार nonzero parameters से elephant curve fit करने की कोशिश है

Fermi की आलोचना से शुरू हुई समस्या

  • 1953 में Enrico Fermi ने Dyson के model की आलोचना करते हुए Johnny von Neumann को quote किया
    • “With four parameters I can fit an elephant, and with five I can make him wiggle his trunk.”
  • इस कथन का अर्थ यह था कि भले ही कोई model complex हो और data से अच्छी तरह fit हो, अगर यह सिर्फ parameters की संख्या बढ़ाने का नतीजा है, तो वास्तविक physical meaning की गारंटी देना मुश्किल है
  • मुख्य सवाल यह है कि क्या सच में सिर्फ चार parameters से हाथी fit किया जा सकता है

मौजूदा solutions कहां requirements से चूकते हैं

  • Wei ने Fourier series से हाथी fit करने की कोशिश की, लेकिन ठीक-ठाक result पाने के लिए 20 से ज़्यादा parameters की जरूरत पड़ी
    • result के बारे में आंका गया कि वह “तीसरी कक्षा के art teacher” को भी शायद संतुष्ट न करे
  • Mayer et al. ने चार complex numbers से हाथी fit किया
    • complex number में real part और imaginary part होते हैं, इसलिए असल में यह 8 parameters इस्तेमाल करने जैसा है
    • अगर zero parameters भी गिने जाएं, तो कुल 20 हो जाते हैं
    • resulting image को Picasso जैसी style में सुंदर माना गया
  • Paintadosi ने दावा किया कि एक ही parameter पर्याप्त है, और एक parameter से कोई भी shape draw कर सकने वाला function बनाया
    • लेकिन यह shape को सैकड़ों या हजारों digits की precision वाले एक real number में map करने वाली encoding के ज्यादा करीब है, इसलिए इस समस्या में इसे valid solution मानना मुश्किल है
    • उस काम का focus यह दिखाना था कि parameter count model complexity का measure होने में fail हो सकता है
  • यह paper पहले problem conditions को व्यवस्थित करता है, फिर पिछली कोशिशों से अलग चार nonzero parameters से हाथी fit करने का तरीका प्रस्तुत करता है

1 टिप्पणियां

 
GN⁺ 2024-07-15
Hacker News की टिप्पणियाँ
  • मुझे लेख का विडंबनापूर्ण पक्ष पसंद आया। यह भी जोड़ना अच्छा होता कि Fermi और von Neumann ने ऐसा क्यों कहा था
    भौतिकी में जब वास्तविकता का मॉडल बनाया जाता है, तो अगर वह प्रयोग से मेल नहीं खाता, तो एक-एक करके parameters जोड़कर डेटा से fit नहीं करना चाहिए। आदर्श रूप से parameters 0 होने चाहिए या कम-से-कम होने चाहिए, और उससे भी गहराई में, parameters सरल मान्यताओं से स्वाभाविक रूप से निकलने चाहिए। अगर parameters 4 हों, तो यह समझना मुश्किल होता है कि मॉडल ने वास्तव में वास्तविकता के किसी पहलू को पकड़ा है या बस प्रयोगात्मक डेटा को fit किया है

    • यह बात पेपर के पहले पैराग्राफ में पहले से ही है, और पेपर खुद भी कुल मिलाकर एक हास्यपूर्ण लेख है
      फिर भी, उस सूक्ति की बुद्धिमत्ता कई क्षेत्रों में काफ़ी भुला दी गई लगती है। कई क्षेत्रों में डेटा को दर्जनों parameters वाले विशाल regression models, या अरबों parameters वाले neural networks से “model” किया जाता है

      In 1953, Enrico Fermi criticized Dyson’s model by quoting Johnny von Neumann: “With four parameters I can fit an elephant, and with five I can make him wiggle his trunk.”[1]. This quote is intended to tell Dyson that while his model may appear complex and precise, merely increasing the number of parameters to fit the data does not necessarily imply that the model has real physical significance.

    • 0-parameter model पहली principles से निकाला जा सकता है, इसलिए वह गणित के ज़्यादा क़रीब लगता है। उदाहरण के लिए, Euclidean space मान लें तो sphere की surface area जैसी expressions मिलती हैं
      मेरे हिसाब से भौतिकी वहाँ से शुरू होती है जहाँ कम-से-कम एक natural constant हो, जैसे वास्तविक space की curvature या gravitational acceleration, जिसे मापना पड़ता है
    • Hodgkin और Huxley ने squid के giant axon का अध्ययन करते हुए neural activity का एक क्रांतिकारी मॉडल बनाया था
      उन्होंने recorded potential और injected current के लिए curve fitting से कई parameters निकाले, और बहुत बाद में पता चला कि वे sodium channels से मेल खाते हैं। इसी तरह अन्य processes potassium channels से मेल खाती थीं। अगर model को 3 parameters से समझाया नहीं जा सकता, तो कई parameters, यहाँ तक कि 4 भी, होने पर ज़्यादा चिंता की बात नहीं लगती
    • वास्तव में पहला implementation James Wei का Least square fitting of an elephant (1975, Chemtech) था
  • यह लेख मज़ेदार है और अच्छी तरह लिखा गया है, लेकिन मुझे लगता है कि यह उससे बढ़कर है
    ML/AI को अक्सर curve fitting भर कहकर मज़ाक या टिप्पणी की जाती है। सिर्फ़ “curve fitting” से क्या कोई बुद्धिमान चीज़ निकल सकती है, इसका जवाब अभी नहीं है, और इसकी बड़ी वजह यह है कि “बुद्धिमान” का मतलब हर व्यक्ति के लिए अलग है
    यहाँ बहुत साफ़ और आसानी से समझ आने वाला curve fitting दिखाया गया है, लेकिन मूल रूप से यह वही प्रक्रिया है। आप एक लक्ष्य तय करते हैं, loss function पर optimize करते हैं, और आशा करते हैं कि वह generalize करेगा। बेशक, यह elephant generalize नहीं करता, लेकिन प्यारा ज़रूर है
    इसलिए हम फिर von Neumann के सवाल पर लौटते हैं: इतने सारे parameters की ज़रूरत क्यों है? विडंबना यह है कि हाल के समय में parameters की बहुत बड़ी संख्या से बहुत कुछ हासिल किया गया है, इसलिए जवाब कुछ ऐसा बन गया है: “बहुत सारे parameters से शानदार चीज़ें की जा सकती हैं”

    • वास्तविक दुनिया पर लगातार curve fitting करते रहना बुद्धिमत्ता पैदा कर सकता है। जो चीज़ गायब है, वह model के भीतर की कोई चीज़ नहीं, बल्कि explore करने, search करने, और अनुभव का दायरा बढ़ाने का mechanism है
      मौजूदा LLMs सिर्फ़ मानव अनुभव पर सवार हैं; उन्होंने अपना अनुभव बनाने में बहुत कम भाग लिया है। इसलिए उन्हें imitation learning या तोता कह दिया जाता है। लेकिन अगर models ज़्यादा agent-जैसे बनें, तो वे अपने लिए उपयोगी अनुभव बना सकते हैं, और AlphaZero ने यह दिखाया है
    • AI में ज़्यादा parameters बेहतर होते हैं, जबकि भौतिकी में इसका उल्टा है
    • बारीकियाँ ही असली बात हैं। reinforcement learning में लक्ष्य बदलता रहता है, और deep learning में over-optimization रोकने के लिए अक्सर early stopping जैसी तकनीकें इस्तेमाल होती हैं
  • Freeman Dyson ने Web of Life इंटरव्यू में उस किस्से को याद किया जिसने इस पेपर को प्रेरित किया। elephant fitting वाले हिस्से पर सीधे जाने वाला लिंक भी है
    [1] https://youtu.be/hV41QEKiMlM
    [2] https://youtu.be/hV41QEKiMlM?t=118

  • एक parameter काफ़ी है: https://aip.scitation.org/doi/10.1063/1.5031956

    • यह कुछ वैसा ही है जैसे कहना कि फ़ाइल के अंदर नहीं बल्कि फ़ाइलनाम में डेटा स्टोर करके unlimited compression हासिल की जा सकती है
    • पेपर में इसे इस तरह कहा गया है

      Paintadosi [4] argues that one parameter is always enough. He constructed
      a function that, through a single parameter, can depict any shape. However, in
      essence, this work is a form of encoding, mapping the shape into a real number
      with precision extending to hundreds or even thousands of decimal places. For
      our problem, this is meaningless, although the paper’s theme is that “parameter
      counting” fails as a measure of model complexity

    • parameters की संख्या एक ग़लत मापदंड है। parameter values में मौजूद information content, entropy, या Kolmogorov complexity जैसी चीज़ों को देखना चाहिए
    • यह कुछ वैसा है जैसे कहना कि पूरी hard disk एक संख्या है
  • अफ़सोस की बात है कि पेपर में constant term, यानी औसत r_0, स्पष्ट रूप से नहीं दिया गया है। यह लगभग 180 के आसपास लगता है, लेकिन image बनाने के लिए यह मान सही रखना पड़ता है, और इसे पाँचवाँ ज़रूरी parameter न मानने का कोई साफ़ तरीका नहीं दिखता
    इसलिए यह कहना मुश्किल है कि लक्ष्य सच में हासिल हो गया। फिर भी, यह वाकई मज़ेदार था

    • मुख्य लेख में कहा गया है कि यह मान fit किए जा रहे data points का औसत मान है। इसे parameter गिनना है या नहीं, यह शायद इस पर निर्भर करता है कि आप normalization को model का हिस्सा मानते हैं या नहीं
  • यह Dyson की Web of Stories इंटरव्यू का एक शानदार हिस्सा था, और लेखकों की तरह यह मुझ पर भी असर कर गया।
    यह उस समय की बात है जब Dyson, Paion की pseudoscalar theory पर प्रारंभिक नतीजे लेकर Fermi के पास गए थे। Fermi ने बहुत जल्दी पूरी बात खारिज कर दी, जो Dyson के लिए झटका था, लेकिन इससे उनका और समय बर्बाद होने से बच गया।
    Fermi: जब आप सैद्धांतिक गणना करते हैं, तो आपके पास या तो एक स्पष्ट physical model होना चाहिए या एक rigorous mathematical foundation। आपके पास इनमें से कोई भी नहीं है। फिट करने के लिए आपने कितने free parameters इस्तेमाल किए?
    Dyson: 4
    Fermi: Johnny von Neumann हमेशा कहा करते थे, “4 parameters से आप एक हाथी को fit कर सकते हैं, और 5 से उसकी सूँड़ हिला सकते हैं।”

  • काश arXiv पर humor और ज़्यादा होता।
    अगर मैं कंपनी के संसाधनों का इस्तेमाल किए बिना, अपने निजी समय में कोई खोज करूँ, तो उसे यथासंभव सबसे मज़ेदार तरीके से प्रकाशित करूँगा।

  • Dr. Octave Levenspiel का ज़िक्र भी ज़रूरी है। मेरे undergraduate दिनों में वे professor emeritus थे, और industrial fluidized bed सहित कई क्षेत्रों में उन्होंने बहुत काम किया था।
    हाथी वाले curve की चर्चा उस समय heterogeneous catalytic reactions में complex multi-parameter fitting की आलोचना के संदर्भ में थी। https://levenspiel.com/elephants/
    वे कुछ समय तक डायनासोर की उड़ान पर एक aerodynamics paper प्रकाशित करने की कोशिश भी करते रहे। http://levenspiel.com/wp-content/uploads/2016/02/DinosaurW.p...
    इस तरह की बौद्धिक जिज्ञासा थोड़ी Feynman की plate-spinning की याद दिलाती है।

  • D’Arcy Thompson की On Growth and Form का ज़िक्र क्यों नहीं है? जीवों पर उनका parameter model काफ़ी शानदार था, भले ही बहुत simple था।
    https://en.wikipedia.org/wiki/On_Growth_and_Form

  • मेरी समझ के मुताबिक, real parameters की Fourier series r(theta) = sum(r_k cos(k theta)) केवल ऐसे “लहरदार वृत्त” जैसे आकार बना सकती है जिनमें origin से निकलने वाली हर radial ray पर सिर्फ़ एक बिंदु हो।
    complex parameters z(theta) = sum(e^(z_ theta)) ज़्यादा टेढ़े-मेढ़े shapes, यानी teapot, बना सकते हैं। ड्रॉ करने वाला arm घूमते समय pen को पीछे भी ले जा सकता है, और हर parameter पिछले parameter से निकाले गए बिंदु के आसपास के छोटे वृत्त पर कहीं भी उस बिंदु को ले जा सकता है।
    ज़रूरी 3B1B वीडियो: https://m.youtube.com/watch?v=r6sGWTCMz2k
    एक complex parameter, 2 real parameters के बराबर होता है, इसलिए सबसे अच्छे 4 cosine curves की तुलना सबसे अच्छे 2 complex exponential curves से करनी चाहिए।