2 पॉइंट द्वारा GN⁺ 2025-02-25 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • संभाव्यता कलन Brownian motion जैसी अनियमित वास्तविक प्रणालियों को समझने के लिए, औपचारिकता से अधिक भौतिक अंतर्ज्ञान और व्युत्पत्ति की प्रक्रिया को प्राथमिकता देकर आगे बढ़ता है
  • असतत binomial distribution और symmetric random walk में trials की संख्या बढ़ाकर और scaling करने पर, central limit theorem के माध्यम से normal distribution और सतत stochastic process तक पहुँचा जा सकता है
  • Brownian motion (W(t)) में independent increments होते हैं और (W(t)\sim N(0,t)) होता है, लेकिन इसका path सतत होते हुए भी लगभग निश्चित रूप से कहीं भी differentiable नहीं होता
  • Itô calculus में (dW=\sqrt{dt}N(0,1)), ((dW)^2\approx dt) जैसे नियमों के कारण सामान्य chain rule में द्वितीय-क्रम का पद जुड़ जाता है
  • stochastic differential equation drift और diffusion के जरिए प्रवृत्ति और randomness को साथ में मॉडल करती है, जबकि Stratonovich पद्धति midpoint evaluation के कारण सामान्य chain rule को सुरक्षित रखती है और physics, control, biological diffusion, तथा numerical simulation में उपयोग होती है

संभाव्यता कलन जिन समस्याओं को संभालता है

  • संभाव्यता कलन Brownian motion और Itô calculus के आधार पर, अनियमित वास्तविक प्रणालियों को गणनायोग्य मॉडल के रूप में संभालने का उपकरण है
  • इसके अनुप्रयोग physics, finance, biology, और machine learning तक फैले हुए हैं
    • physics: Einstein ने Brownian motion के कंपन का molecules की टक्करों से मेल खाना दिखाकर atom के अस्तित्व का समर्थन किया
    • finance: Black-Scholes equation जैसे option pricing model, (dS=\mu Sdt+\sigma SdW) रूप की stochastic differential equation पर निर्भर करते हैं
    • biology: random walk प्रजातियों के diffusion या neuron firing को मॉडल करता है
    • machine learning: Song et al. (2021) ने Itô calculus-आधारित stochastic differential equation से समय के साथ noise evolution को मॉडल किया, और इसे reverse direction में इस्तेमाल कर नए samples बनाए

Binomial distribution से सतत stochastic process तक

  • Pascal का triangle हर चरण में बाएँ या दाएँ जाने वाले paths की संख्या गिनता है, और (n)वीं row के (k)वें स्थान तक पहुँचने के तरीकों की संख्या (\binom{n}{k}=\frac{n!}{k!(n-k)!}) होती है
  • independent trials में (k) बार success और (n-k) बार failure होने की probability इस प्रकार है

[ P(k \text{ wins in } n \text{ trials})=\binom{n}{k}p^kq^{n-k} ]

  • independence assumption एक मजबूत शर्त है, इसलिए sports की winning streak या stock price जैसी वास्तविक स्थितियों में, जहाँ psychology या momentum शामिल हो, यह मॉडल सटीक नहीं रह सकता
  • गिरती हुई वस्तु की गति, gas diffusion, stock price fluctuation, या द्रव में molecules की टक्कर जैसी सतत बदलती घटनाओं को केवल points और sums से संभालना कठिन है; इनके लिए intervals और integrals की आवश्यकता होती है

Random walk और central limit theorem

  • (p=0.5) वाले symmetric random walk में एक step का displacement इस प्रकार माना जाता है

[ X(t)= \begin{cases} 1 & \text{with probability } \frac{1}{2}\ -1 & \text{with probability } \frac{1}{2} \end{cases} ]

  • प्रत्येक (X(t)) का mean 0 और variance 1 है, और अलग-अलग समयों के steps को independent माना जाता है
  • कुल displacement को independent random variables के sum के रूप में लिखा जा सकता है

[ S(n)=X(1)+X(2)+\dots+X(n)=\sum_{t=1}^{n}X(t) ]

  • central limit theorem के अनुसार, independent और identically distributed random variables (X_1,\dots,X_n) का sum (n\to\infty) पर normal distribution के करीब पहुँचता है

[ X_1+\dots+X_n\sim N(n\mu,n\sigma^2) ]

  • इस random walk में निम्न संबंध मिलता है

[ S(n)\sim N(0,n) ]

[ \lim_{n\to\infty}\frac{1}{\sqrt{n}}S(n)=N(0,1) ]

  • इसलिए “सतत binomial distribution” अंततः normal distribution तक पहुँचता है

Brownian motion की परिभाषा

  • 1820 के दशक में Robert Brown ने पानी पर छोटे कणों या pollen की गति का अवलोकन किया, जो अत्यंत अनियमित थी; छोटे पैमाने पर बाहरी बलों से होने वाली वास्तविक गति इतनी संवेदनशील दिखती है कि वह पिछले motion को दबा देती है
  • सरल गणितीय मॉडल में अलग-अलग समयों की घटनाओं को independent माना जाता है, और position symmetry के कारण समय (t) पर कण की औसत स्थिति को origin के आसपास माना जाता है
  • एक सतत random walk में निम्न गुण होने चाहिए
    • आरंभिक बिंदु को गणितीय सुविधा के लिए 0 लिया जाता है
    • दिशा में कोई bias नहीं होता, इसलिए प्रत्येक step का expected displacement और कुल expected displacement 0 होता है
    • अलग-अलग समयांतरालों के displacement independent होते हैं
    • path jump या gap के बिना सतत होता है
    • किसी निश्चित समय पर स्थिति का distribution normal होना चाहिए
  • Brownian motion को प्रायः (B_t), और Wiener process को (W_t) लिखा जाता है; यहाँ समय-निर्भरता पर जोर देने के लिए (W(t)) का उपयोग किया गया है
  • इसके प्रमुख गुण इस प्रकार हैं

[ W(0)=0 \quad \text{almost surely} ]

[ W(t)\sim N(0,t) ]

[ \Delta W(s,t)\sim N(0,t-s) ]

  • अलग-अलग intervals के increments (\Delta W(t_1,t_2)) और (\Delta W(t_2,t_3)), जहाँ (t_1<t_2\le t_3), independent होते हैं
  • इससे (E[W(t)]=0), (Var(W(t))=t) निकलता है
  • sample path (t\mapsto W(t)) लगभग निश्चित रूप से हर (\gamma<\frac12) के लिए uniformly Hölder continuous है, लेकिन (\gamma\ge\frac12) पर कहीं भी Hölder continuous नहीं है, और विशेष रूप से कहीं भी differentiable नहीं है

Itô calculus के मुख्य नियम

  • Brownian motion सतत तो है, लेकिन इतनी अनियमित है कि उसका सामान्य derivative मौजूद नहीं होता
  • छोटे interval (dt) में निम्न संबंध सही है

[ \Delta W(t,t+dt)\sim N(0,dt)=\sqrt{dt}N(0,1) ]

[ \frac{\Delta W(t,t+dt)}{dt}=\frac{1}{\sqrt{dt}}N(0,1) ]

  • (dt\to0) पर (\frac{1}{\sqrt{dt}}) अनंत की ओर बढ़ता है, इसलिए यह किसी finite derivative पर अभिसरित नहीं होता
  • Kiyosi Itô ने 1940 के दशक में Brownian motion की randomness के अनुरूप Itô calculus विकसित किया, और यही stochastic calculus की नींव बना
  • (dW) और ((dW)^2)

    • Brownian motion का छोटा परिवर्तन इस प्रकार परिभाषित किया जाता है
    • [
    • dW:=W(t+dt)-W(t)
    • ]
    • [
    • dW=\sqrt{dt}N(0,1)
    • ]
    • (dW), सामान्य calculus के deterministic (dx) से अलग, random होता है; इसका परिमाण (\sqrt{dt}) के अनुपात में होता है और इसका sign standard normal distribution पर निर्भर करता है
    • इसका expected value और variance इस प्रकार हैं
    • [
    • E[dW]=0
    • ]
    • [
    • Var(dW)=E[(dW)^2]=dt
    • ]
    • ((dW)^2) का expected value (dt) और variance (2dt^2) है; (dt\to0) पर इसकी variability नगण्य हो जाती है, इसलिए Itô calculus में ((dW)^2\approx dt) माना जाता है
    • सामान्य calculus में ((dx)^2) इतना छोटा होता है कि गायब हो जाता है, लेकिन stochastic calculus में ((dW)^2) का scale (dt) के बराबर होता है, इसलिए गणना के नियम बदल जाते हैं
  • Itô integral

    • जैसे सामान्य integral (\int_a^b f(x)dx), Riemann sums की limit के रूप में परिभाषित होता है, वैसे ही Brownian motion के लिए (\int_0^t f(s)dW(s)) पर विचार किया जाता है
    • partition (s_0,\dots,s_n) के लिए इसे निम्न sum से approximate किया जाता है
    • [
    • \int_0^t f(s)dW(s)\approx \sum_{i=0}^{n-1}f(s_i)\Delta W(s_i,s_{i+1})
    • ]
    • इस integral का परिणाम random variable होता है, जो (W(t)) की randomness को दर्शाता है
    • (f(s_i)) को left endpoint पर evaluate करने से केवल समय (s_i) तक की जानकारी उपयोग होती है, इसलिए इसमें भविष्य को न देखने वाला non-anticipating गुण होता है
  • Itô lemma

    • सामान्य calculus का chain rule, (f(t,W(t))) के लिए इस प्रकार है
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW
    • ]
    • Brownian motion के rough nature के कारण Taylor expansion में second-order term गायब नहीं होता
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW+\frac{1}{2}\frac{\partial^2 f}{\partial W^2}(dW)^2+\text{smaller terms}
    • ]
    • (dt^2) और (dt,dW) गायब हो जाते हैं, लेकिन ((dW)^2\approx dt) बचा रहता है
    • इसलिए Itô lemma का रूप निम्न हो जाता है
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW+\frac{1}{2}\frac{\partial^2 f}{\partial W^2}dt
    • ]
    • अतिरिक्त पद (\frac12\frac{\partial^2 f}{\partial W^2}dt), Brownian motion के second-order effect के कारण आता है
    • (f(W)=W^2) होने पर गणना इस प्रकार मिलती है
    • [
    • d(W^2)=2W,dW+dt
    • ]
    • [
    • W(t)^2=\int_0^t2W(s)dW(s)+t
    • ]
    • यहाँ (t) पद, (E[W(t)^2]=t) के अनुरूप है, और integral वाला पद mean 0 वाला random component है

stochastic differential equation से मॉडलिंग

  • Itô calculus, Brownian motion के सापेक्ष integration और chain rule देता है, इसलिए randomness और trend दोनों वाले systems को stochastic differential equation (SDE) के रूप में मॉडल किया जा सकता है
  • एक सामान्य SDE इस प्रकार है

[ dX(t)=a(t,X(t))dt+b(t,X(t))dW(t) ]

  • प्रत्येक पद का अर्थ निम्न है
    • (X(t)): समय के साथ बदलने वाली मात्रा
    • (a(t,X(t))dt): drift, व्यवस्थित भाग
    • (b(t,X(t))dW(t)): diffusion, Brownian motion से आने वाला random perturbation
  • SDE का solution कोई fixed curve नहीं, बल्कि हर run पर बदलने वाला random path होता है, जिसका statistical pattern विश्लेषित किया जा सकता है
  • सामान्य रूप की Itô lemma

    • (dX=b(t,X(t))dt+\sigma(t,X(t))dW) के लिए (f(t,X(t))) की Itô lemma इस प्रकार है
    • [
    • df=(f_t+bf_X+\frac{1}{2}\sigma^2f_{XX})dt+\sigma f_XdW
    • ]
    • इसे (dX=O(dW)) और (dX^2=O(dW^2)) तक को ध्यान में रखकर निकाला जाता है
  • drift और diffusion

    • drift (a(t,X)) औसत दिशा तय करता है, और diffusion (b(t,X)) random fluctuation की तीव्रता तय करता है
    • (b=0) होने पर यह सामान्य differential equation बन जाता है, और (a=0) होने पर scaled Brownian motion
    • एक सरल रूप इस प्रकार लिखा जा सकता है
    • [
    • dX(t)=\mu dt+\sigma dW(t)
    • ]
    • (X(0)=0) होने पर इसका solution है
    • [
    • X(t)=\mu t+\sigma W(t)
    • ]
    • चूँकि (W(t)\sim N(0,t)), इसलिए इसका distribution होगा
    • [
    • X(t)\sim N(\mu t,\sigma^2t)
    • ]
    • यह समय के साथ रैखिक drift और फैलते हुए noise की प्रक्रिया है, और steady growth तथा volatility वाले stock जैसे मॉडल का आधारभूत रूप है
  • geometric Brownian motion

    • जिन systems में परिवर्तन मात्रा के आकार के अनुपात में होता है, वहाँ geometric Brownian motion (GBM) उपयोग किया जाता है
    • [
    • dS(t)=\mu S(t)dt+\sigma S(t)dW(t)
    • ]
    • (\mu S(t)) proportional drift है, और (\sigma S(t)) proportional noise
    • (\frac{dS}{S}=\mu dt+\sigma dW), trend और randomness दोनों वाली अनुपाती change को दर्शाता है
    • (f=\ln S) रखकर Itô lemma लागू करने पर मिलता है
    • [
    • d(\ln S)=\left(\mu-\frac12\sigma^2\right)dt+\sigma dW
    • ]
    • integrate करने पर solution मिलता है
    • [
    • S(t)=S(0)\exp\left(\left(\mu-\frac12\sigma^2\right)t+\sigma W(t)\right)
    • ]
    • drift का (-\frac12\sigma^2) से adjust होना noise के second-order effect के कारण है, और यही रूप finance के Black-Scholes model की नींव है
    • GBM जैसी analytic solution दुर्लभ अपवाद हैं; अधिकांश SDE के लिए numerical simulation या Fokker-Planck जैसी equations के जरिए statistical analysis की आवश्यकता होती है

Stratonovich calculus

  • Itô lemma में second derivative term शामिल होने से गणना कभी-कभी जटिल हो सकती है
  • Stratonovich calculus stochastic integral के evaluation point को बदलकर सामान्य calculus के chain rule को सुरक्षित रखता है
  • Itô integral हर interval के left endpoint का उपयोग करता है, जबकि Stratonovich integral midpoint evaluation rule का उपयोग करता है
  • generalized evaluation point को इस प्रकार लिखा जा सकता है

[ \int_0^T f(X(t))\diamond dW

\lim_{n\to\infty}\sum_{i=0}^{n-1} f(X(t_i)+\lambda\Delta X(t_i,t_{i+1})) \Delta W(t_i,t_{i+1}) ]

  • deterministic calculus में (O(dX^2)\to0) होने से evaluation point का चयन महत्वपूर्ण नहीं होता, लेकिन stochastic calculus में (O(dW^2)\to O(dt)) होने से evaluation point महत्वपूर्ण हो जाता है
  • chain rule (df=f_X\circ dX) को सुरक्षित रखने के लिए Taylor expansion की तुलना से (\lambda=\frac12) आवश्यक होता है
  • इसलिए Stratonovich integral इस प्रकार परिभाषित किया जाता है

[ \int_0^T f(X(t))\circ dW

\lim_{n\to\infty}\sum_{i=0}^{n-1} f\left(\frac{X(t_i)+X(t_{i+1})}{2}\right) \Delta W(t_i,t_{i+1}) ]

  • Itô और Stratonovich रूपांतरण

    • यदि एक ही stochastic process को निम्न दो रूपों में दिया गया हो
    • [
    • dX=adt+bdW=\tilde a dt+b\circ dW
    • ]
    • तब drift term का संबंध इस प्रकार होता है
    • [
    • a=\tilde a+\frac12 b_Xb
    • ]
    • diffusion coefficient (b) समान रहता है, लेकिन Itô और Stratonovich निरूपण के बीच drift function बदल जाती है

Stratonovich पद्धति का उपयोग किस संदर्भ में होता है

  • Stratonovich calculus midpoint evaluation rule के आधार पर Itô की left-endpoint पद्धति से अलग stochastic integral बनाता है, और यह कुछ भौतिक प्रणालियों या गणना-सरलीकरण वाले संदर्भों के लिए उपयुक्त है
  • physics में multiplicative noise के साथ state-dependent noise वाली damped oscillator को इस प्रकार लिखा जा सकता है

[ dX=-kXdt+\sigma X\circ dW ]

  • (f(X)=\ln X) पर Stratonovich chain rule लागू करने पर मिलता है

[ d(\ln X)=-kdt+\sigma\circ dW ]

[ X(t)=X(0)e^{-kt+\sigma W(t)} ]

  • Wong-Zakai theorem बताती है कि जब थोड़े smooth वास्तविक noise को white noise limit की ओर भेजा जाता है, तब Stratonovich SDE प्राप्त होता है
  • stochastic control में (dX=(aX+u)dt+\sigma X\circ dW) जैसे systems में Stratonovich नियम classical control intuition से मेल खाता है, इसलिए control input (u(t)) की design सरल हो सकती है
  • biological diffusion में (\sigma(X)=\sqrt{2D(1+kX^2)}) जैसे position-dependent noise वाले model में Stratonovich भौतिक conservation laws को बेहतर दर्शाता है
  • numerical simulation में Stratonovich midpoint method के साथ अच्छी तरह मेल खाता है, इसलिए chemical reaction kinetics जैसे models में numerical artifacts कम करने के लिए इसका उपयोग किया जा सकता है
  • चयन का मानदंड संदर्भ पर निर्भर करता है
    • Stratonovich उन systems के लिए उपयुक्त है जहाँ noise का संबंध physical continuity या symmetry से होता है
    • Itô, भविष्य की जानकारी का उपयोग न करने वाले non-anticipating गुण के कारण finance में प्रमुख रूप से इस्तेमाल होता है
    • रूपांतरण सूत्र (a=\tilde a+\frac12bb_X) का उपयोग कर दोनों निरूपणों के बीच जाया जा सकता है

1 टिप्पणियां

 
GN⁺ 2025-02-25
Hacker News की राय
  • उन्नत undergraduate/graduate स्तर की गणितीय जानकारी रखने वाले पाठकों के लिए यह stochastic calculus परिचय सामग्री उपयोगी रही: https://almostsuremath.com/stochastic-calculus/

    • अच्छी सामग्री है। मैंने graduate school में यह क्षेत्र पढ़ा था, और मेरे हिसाब से यह सामग्री शुरुआती से उन्नत PhD स्तर तक फैली हुई, काफ़ी कठिन है
      संबंधित विषयों से बहुत overlap रखने वाली और प्रेरक textbook के रूप में यह भी है: https://www.amazon.com/Stochastic-Integration-Differential-E...
  • मुझे जिज्ञासा है कि stochastic calculus ऐसा क्षेत्र है जिसमें संभावित घटनाक्रमों को बहुत बार simulate करने के लिए computer की ज़रूरत होती है, या फिर dW का distribution पता होने पर महत्वपूर्ण final output और probability distribution को ज़्यादा elegant mathematical तरीके से हल किया जा सकता है
    यह लेख शानदार था, और पहले भी stochastic calculus देखा था, लेकिन इस बार पहली बार लगा कि सच में समझना शुरू कर रहा हूँ

    • सवाल का ज़्यादा सीधे जवाब दें तो, आमतौर पर analytical answer सिर्फ़ simple distributions पर simple questions के लिए ही मिलता है
      अगर problem जटिल है या distribution जटिल है, या दोनों, तो numerical methods चाहिए। इसका मतलब यह नहीं कि Monte Carlo की तरह बहुत सारे simulations चलाने ही पड़ेंगे, हालांकि वह तरीका भी उचित है लेकिन महंगा है
      किसी खास probability को लेकर ज़्यादा सीधे सवालों का जवाब Monte Carlo के बिना भी दिया जा सकता है। Fokker-Planck equation एक partial differential equation है जिसे कई non-Monte Carlo तरीकों से हल किया जा सकता है, और rare-event simulation से आने वाले quasipotential और committor function भी “directly” compute किए जा सकते हैं। मुख्य कठिनाई यह है कि ऐसे objects पर standard numerical methods लगाने पर curse of dimensionality का सामना करना पड़ता है। high-dimensional,甚至 infinite-dimensional cases में इन्हें अच्छी तरह compute करना applied mathematics का बहुत hot research area है। निजी तौर पर, अगर mathematics का actual physical applications से साफ़ matching न हो, तो मुझे ये चीज़ें ज़्यादातर समय की बर्बादी जैसी लगती हैं
    • यह इस पर निर्भर करता है कि आप क्या calculate करना चाहते हैं, लेकिन generally stochastic differential equation (SDE) के solution की time t पर probability density function time में first-order और space में second-order partial differential equation satisfy करती है
      physicists इसे Fokker-Planck equation कहते हैं, mathematicians Kolmogorov forward equation। कुछ special exceptions को छोड़कर exact analytical solution नहीं होता और numerical solution चाहिए। हालांकि high dimensions में partial differential equation solve करने की cost बहुत बड़ी होती है, इसलिए SDE solve करके Monte Carlo sampling करना सस्ता पड़ता है
      दूसरे तरह के सवाल भी हो सकते हैं, जैसे किसी random event के occur होने पर solution क्या है, और उन पर भी मिलती-जुलती logic लागू होती है। साथ ही stochastic calculus SDEs से निपटने में बहुत उपयोगी है, लेकिन अगर आपकी रुचि दूसरे तरह की Markov processes या non-Markov processes में है, तो अलग tools चाहिए हो सकते हैं
      दूसरे comment की तरह, special cases में SDE खुद भी exact solution रख सकती है, लेकिन generally ऐसा नहीं होता
      यह explanation Gaussian white noise को forcing term के रूप में रखने वाली differential equations, यानी SDEs, तक सीमित है। Markov jump processes जैसे अन्य stochastic processes में distribution की evolution equation का रूप अलग होता है, लेकिन Chapman-Kolmogorov equation जैसे general principles कुछ हद तक साझा होते हैं
    • कुछ simple stochastic differential equations के explicit analytical solutions integrals या simple ordinary differential equations की तरह निकाले जा सकते हैं। classic Black-Scholes equation इसका example है
      ज़्यादा complex equations आमतौर पर ऐसे solve नहीं हो पातीं। अक्सर जो चाहिए होता है वह किसी time पर stochastic process के function का expectation होता है, और दिखाया जा सकता है कि यह expectation एक specific deterministic partial differential equation follow करता है। इसके बाद इसे numerical partial differential equation solver से हल करते हैं
      dimension high हो या process path पर strongly depend करता हो और Markovian न हो, तो अंततः “कई संभावित घटनाक्रमों” को सच में simulate करने वाली Monte Carlo simulation इस्तेमाल करनी पड़ती है
    • पहले मैंने stochastic chemical reaction simulation की दिशा में पढ़ाई की थी, और मुझे लगता है जवाब अक्सर “हाँ” होता है, लेकिन हमेशा नहीं
      उदाहरण के लिए, random walk normal distribution बन जाता है और mean तथा variance infinity की ओर जाते हैं—यह भी पता हो सकता है, इसलिए input से ही time के साथ variance function तय किया जा सकता है; मैं इसे ऐसे case के रूप में समझता हूँ जो elegant analytical solution तक ले जाता है
      लेकिन कई मामलों में analytical solution नहीं होता, इसलिए stochastic algorithms चलाने पड़ते हैं। simple stochastic chemical kinetics में Gillespie algorithm ऐसा ही example है
    • यह इस पर निर्भर करता है कि आप क्या जानना चाहते हैं। अगर कुछ trajectories चाहिए, तो stochastic differential equation simulation की ज़रूरत होती है
      अगर आपको सिर्फ़ paths की statistics जाननी हैं, तो कई मामलों में partial differential equation यानी Fokker-Planck equation बनाकर और solve करके path density निकाली जा सकती है
  • अगले step के रूप में Langevin Dynamics है, जिसमें system के पास damped momentum होता है और noise momentum में enter करता है
    इसका इस्तेमाल molecular dynamics simulations में भी होता है और Bayesian MCMC sampling में भी किया जा सकता है
    अजीब बात है कि AI के संदर्भ में Langevin Dynamics का ज़िक्र करते समय मैंने कई बार momentum के इस्तेमाल को छोड़ते देखा है। जबकि AI में momentum वाली gradient descent widely इस्तेमाल होती है। और भ्रम बढ़ाने के लिए “stochastic” शब्द का मतलब हर step पर data के एक subset sample से gradient approximate करना भी होता है। चाहें तो दोनों तरह की randomness एक साथ apply कर सकते हैं

    • Langevin का momentum counterpart underdamped Langevin के नाम से जाना जाता है, और discretization को पर्याप्त optimize करने पर यह ordinary Langevin से तेज़ converge करता है
      AI में यह कम क्यों इस्तेमाल होता है, मुझे ठीक-ठीक नहीं पता, लेकिन लगता है AI applications की non-convexity समस्या पैदा करती है। log-concave setting में भी sampling पहले से ही काफी कठिन problem है
  • stochastic calculus पर मेरी निजी पसंदीदा सामग्री Eugene Wong की Stochastic Processes in Information and Dynamical Systems, McGraw-Hill, New York, 1971 है

    • पुरानी किताब है, लेकिन मुझे लगता है बहुत साफ़ लिखी गई है, और शुरुआत में measure theory की explanation ही अपने-आप में काफ़ी valuable थी
  • stochastic calculus पढ़ने की याद अब भी है
    यह भी याद है कि सामान्य statistics में standard deviation और quadratic variation variance निकालने के तरीके से थोड़ा अलग होते हैं—यह बात मैंने नोट कर रखी थी। कुछ ऐसा कि 1 का फर्क होता है या square अलग होता है, और मैंने कभी यह पता लगाने के लिए नोट किया था कि ऐसा क्यों है। शायद stochastic volatility की वजह से हो

    • पूरी population का variance इस तरह परिभाषित होता है: sum i=1..N (x_i - mu)^2 / N
      यहाँ mean mu := sum x_i / N population का वास्तविक mean है
      वहीं किसी distribution से independent and identically distributed n samples लेने पर, distribution variance का best estimator sum i=1..n (x_i - a )^2 / (n-1) होता है
      यहाँ mean mu को sample mean a := sum x_i / n से बदल दिया जाता है, और N की जगह n-1 से divide किया जाता है। “Best” का मतलब unbiased estimator है, और दूसरी expression का expected value population variance होता है—यह एक उबाऊ लेकिन कठिन नहीं calculation से verify किया जा सकता है
    • अगर sample variance के बारे में सोचें, तो इसे दो तरीकों से approach किया जा सकता है
      पहला, sample variance sum(x_i) / n वाले sample mean पर depend करता है। अगर n samples में से पहले n-1 पता हों और sample mean भी पता हो, तो last value तय हो जाती है, इसलिए कम-से-कम n-1 को degrees of freedom के रूप में समझा जा सकता है। higher sample moments को भी similar degrees-of-freedom logic से मोटे तौर पर समझा जा सकता है, हालांकि यह गलत भी हो सकता है
      दूसरा, अधिक mathematical तरीके से देखें तो biased_sample_variance = sum((x_i - sum(x_i) / n)^2) / n है। कई sample sets के लिए इस biased sample variance का average population variance नहीं, बल्कि (n - 1) / n * population_variance बनता है। इसलिए n / (n - 1) से multiply करने पर unbiased sample variance sum((x_i - sum(x_i) / n)^2) / (n - 1) मिलता है। flow में आ जाएँ तो यह math काफी मजेदार है
  • हाल ही में ऐसा एक example मिला। मान लें हम एक “game” खेलते हैं। 0 और 1 के बीच uniform distribution से random number A निकालते हैं, और उसी distribution से दूसरा number B निकालते हैं
    अगर A > B हो, तो B को फिर से draw करते हैं, और A वही रहता है। required average number of draws, यानी A की average “winning streak”, कितनी होगी?
    जवाब infinity है। क्योंकि कभी-कभी A बहुत ज्यादा high निकल जाता है, और उसे beat करने के लिए लाखों draws लग सकते हैं

    • Calculation लिखें तो ऐसा है। अगर A से निकली value p है, तो B को एक बार draw करने पर B > A होने की probability (1-p) है
      इसलिए B के n बार draw होने के बाद A से छोटा या बराबर हो जाने की probability p^(n-1) (1-p) वाली geometric distribution बनती है। expected number of draws 1/p है, और E[draws] = E[E[draws|A=p]] = \int_0^1 E[draws|A=p] dp = \int_0^1 (1/p) dp होता है, इसलिए जैसा कहा, यह infinity तक diverge करता है
      शक नहीं था, बस calculation देखना चाहता था
    • जिन्हें रुचि हो, उनके लिए मुझे लगता है कि यह https://en.wikipedia.org/wiki/St._Petersburg_paradox का example है
    • सवाल की wording में “फिर से draw करना” सिर्फ B पर apply होता है या A को भी फिर से draw किया जाता है, यह ambiguous था। क्या infinity वाला जवाब केवल पहले case के लिए माना जाए?
    • क्या इसे prove करने के लिए सच में stochastic calculus की जरूरत है? Fixed A के लिए required sample count का expected value 1/(1-A) है, इस fact पर आधारित standard integral से काम चल जाना चाहिए
  • HN पाठक से सवाल। चूहे के जीनोम में ऐसे लगभग 50 loci परिभाषित किए हैं जिनमें मृत्यु-दर को नियंत्रित करने वाले DNA अंतर शामिल हैं, और उनमें से ज़्यादातर के जटिल उम्र-निर्भर actuarial effects हैं
    मैं मृत्यु की उम्र का अनुमान लगाना चाहता हूँ। क्या चूहों की life expectancy के actuarial prediction के लिए stochastic calculus उपयोगी तरीका होगा? इसलिए यह पोस्ट HN के शीर्ष पर आई देखकर अच्छा लगा

    • stochastic calculus सबसे उपयोगी तब होता है जब ordinary calculus की तरह एक समय-बिंदु और दूसरे समय-बिंदु में सिर्फ कुछ state variables का फर्क हो और वे काफ़ी मिलते-जुलते हों; अगर हर समय-बिंदु की प्रकृति बहुत अलग हो तो यह कम उपयोगी होता है
      सवालों की संख्या, यानी loci की संख्या, समय को तर्कसंगत रूप से बाँटा जा सकने वाले intervals की संख्या जैसी लगती है। अगर मैं गलत नहीं हूँ, तो चूहे के जीवनकाल के 1/50 जितना मृत्यु-समय बदलने वाला प्रभाव detect करना कठिन होगा। समय intervals भी बहुत ज़्यादा नहीं हैं, और state variables के interaction का model भी नहीं है, इसलिए आप model-free statistical methods इस्तेमाल करेंगे; ऐसे में non-continuous methods से मिलने वाली लगभग सारी value मिल ही जाएगी
    • genes की मौजूदगी/गैर-मौजूदगी को साधारण 0-1 variables मानकर L1 regularized regression लागू करूँगा। L1 regularization इस समस्या की high-dimensionality संभालने में मदद करता है: https://en.wikipedia.org/wiki/Lasso_(statistics)
      target उम्र है, इसलिए मैं यह नहीं मानूँगा कि underlying Gaussian distribution है। यह बदलाव जितना लगता है उतना कठिन नहीं है: https://en.wikipedia.org/wiki/Generalized_linear_model
      हमेशा की तरह, अपने आस-पास के किसी statistician से सलाह लेना अच्छा रहेगा
    • मैं “नहीं” कहकर पक्का निष्कर्ष देने को तैयार नहीं हूँ और यह application पर निर्भर करता है, लेकिन description से यह graph-based Bayesian statistics के लिए ज़्यादा सही task लगता है
    • stochastic calculus ऐसे systems से निपटता दिखता है जिनका output smooth real-valued होता है। मूल रूप से इसका इस्तेमाल ऐसे systems को model करने में होता है जो हर interval में थोड़ा-थोड़ा random ऊपर-नीचे चलते हैं, जैसे random walk
      लेकिन अगर आप समय के मुकाबले survival/death देख रहे हैं, तो output binary है, और असल में मिलने वाली जानकारी सिर्फ मृत्यु का समय है, इसलिए random walk model शायद ज़रूरी नहीं या वांछित नहीं होगा; कोई अधिक general statistical model सही लगता है। अगर death status के अलावा कोई और variables measure कर रहे हैं, तो probabilistic model मदद कर सकता है
      साथ ही अगर 50×X bytes की सारी जानकारी life expectancy को प्रभावित करती है, तो यह कठिन समस्या है, लेकिन कई discrete inputs और एक smooth output होने के कारण यह neural networks के लिए काफ़ी उपयुक्त है। neural network और linear model दोनों आज़माएँ और देखें कि neural network कितना बेहतर है; इससे समझ आएगा कि linear से अधिक complex interactions हो रहे हैं या नहीं
    • अगर आपसे छूट गया हो, तो इसी सवाल का जवाब देने के लिए https://en.m.wikipedia.org/wiki/Survival_analysis मौजूद है
      अगर practical तरीके से approach करूँ, तो समय को discretize करूँगा और “उस समय तक जीवित रहने की शर्त पर X महीने में मरने की probability” predict करने के लिए classic machine learning लागू करके data पर fit करूँगा। इससे data की errors और संभावित समस्याएँ ढूँढना बहुत आसान हो जाएगा
      stochastic calculus या full-fledged survival analysis को मैं तभी चुनूँगा जब memorylessness जैसे मौजूदा mathematical properties और किसी खास protein के behavior जैसी physical/biological properties के बीच connection prove या derive करना हो। यह बहुत शानदार होगा, लेकिन काफ़ी कठिन है, खासकर जब data सीमित हो। मेरी समझ में finance papers में stochastic analysis का उपयोग भी लगभग ऐसा ही होता है: system की किसी universal mathematical property के बारे में assumption लेना, और फिर prove करना कि वह real data पर fit होती है
  • Itô calculus के बारे में मेरी समझ यह है। शुरुआत में जो एकमात्र random process हम समझते हैं वह Brownian motion है, और सौभाग्य से हम coordinates बदल सकते हैं

    • क्या आप point 2 को थोड़ा और विस्तार से समझा सकते हैं?
  • यह दिखाने वाला सचमुच अच्छा model है कि beginners-friendly introductory article कैसे लिखा जाना चाहिए
    खासकर ordinary calculus में गायब हो जाने वाला dW^2 term यहाँ भी important बना रहता है—इससे Itô's lemma की motivation समझाने वाला हिस्सा और Stratonovich में convert करने वाला हिस्सा बहुत अच्छा है

  • इस वाक्य को कैसे पढ़ना चाहिए, इस पर मदद चाहिए: “Brownian motion and Itô calculare a notable example of fairly high-level mathematics that are applied to model the real world”
    समझ नहीं आ रहा कि “Itô calculare” क्या होना चाहिए था। “Its calculation”?