1 पॉइंट द्वारा GN⁺ 2024-08-01 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • 2015 की शरद ऋतु में Carnegie Mellon 36-401 Modern Regression के lecture notes पर आधारित, linear regression सीखने या पढ़ाने वालों के लिए यह एक शैक्षणिक manuscript है
  • linear regression को 1960 के दशक वाली assumptions में बाँधकर नहीं रखता, और Gaussian noise व सही तरीके से specified linear model पर निर्भर theory का भार कम करता है
  • भले ही वे computationally अधिक intensive हों, robust techniques को महत्व देता है, और यह भी बताता है कि manuscript खुद शायद इस दिशा में पर्याप्त आगे नहीं बढ़ पाया हो
  • Advanced Data Analysis from an Elementary Point of View के दूसरे chapter से कुछ overlap है, लेकिन इसमें बहुत-सा नया और अधिक lower-level material भी शामिल है
  • table of contents optimal prediction, least squares method, maximum likelihood method, diagnostics, inference, multicollinearity, model selection, weighted/generalized least squares, variable selection, trees और bootstrap तक व्यापक रूप से फैला है

manuscript की प्रकृति और approach

  • यह manuscript 36-401, Modern Regression, in fall 2015 के lecture notes का संकलन है
  • यह मानते हुए भी कि linear regression पर पहले से बहुत सामग्री उपलब्ध है, इसे सीखने या पढ़ाने वालों के लिए उपयोगी होने की संभावना के कारण सार्वजनिक किया गया है
  • statistics 1960 के बाद विकसित हुई है—इस दृष्टिकोण से सही तरीके से specified linear model और Gaussian noise पर निर्भर theory पर कम जोर दिया गया है
  • इसे अधिक computationally intensive लेकिन robust techniques को प्राथमिकता देने की दिशा में बनाया गया है, और लेखक जोड़ते हैं कि वे शायद इस दिशा में पर्याप्त दूर तक नहीं जा पाए हों
  • Advanced Data Analysis from an Elementary Point of View से इसका कुछ overlap है, खासकर दूसरे chapter “The Truth About Linear Regression” से
  • साथ ही इसमें बहुत-सा नया और अधिक lower-level material भी शामिल है, और feedback व corrections, खासकर bug fixes, का स्वागत है

दायरा और updates

  • मौजूदा table of contents linear regression की basic modeling से लेकर diagnostics, inference और extension techniques तक जाती है
  • basic modeling और simple regression

    • Optimal Prediction
    • Introducing Statistical Modeling
    • Simple Linear Regression Models, with Hints at Their Estimation
    • The Method of Least Squares for Simple Linear Regression
    • The Method of Maximum Likelihood for Simple Linear Regression
    • Diagnostics and Modifications for Simple Regression
    • Inference on Parameters
    • Predictive Inference for the Simple Linear Model
    • Interpreting Parameters after Transformation
    • F-Tests, R^2, and Other Distractions
    • Simple Linear Regression in Matrix Format
  • multiple regression और extended topics

    • Multiple Linear Regression
    • Diagnostics and Inference for Multiple Linear Regression
    • Polynomial and Categorical Regression
    • Multicollinearity
    • Tests and Confidence Sets
    • Interactions
    • Outliers and Influential Points
    • Model Selection
    • Review
    • Weighted and Generalized Least Squares
    • Variable Selection
    • Trees
    • The Bootstrap I
    • The Bootstrap II
    • आगे चलकर Data Over Space and Time class की linear spatio-temporal estimation and prediction सामग्री manuscript में शामिल हो सकती है
    • उदाहरण के तौर पर Wiener filter, kriging आदि का उल्लेख है
    • आखिरी text update R update के बाद code को फिर से चलाने और typos ठीक करने के लिए था, और तारीख 20 अक्टूबर 2025 है

1 टिप्पणियां

 
GN⁺ 2024-08-01
Hacker News राय
  • Linear regression को अक्सर कम आंका जाता है

    1. आम statistical tests सभी linear models हैं: https://lindeloev.github.io/tests-as-linear/
    2. Linear model का मतलब है कि वह parameters के हिसाब से linear है, response value के हिसाब से नहीं। उदाहरण के लिए y = a*sin(x)+bx^2 भी एक linear model है
    3. सही spline basis चुनने पर predictors और response value के बीच कई nonlinear संबंधों को भी linear model से model किया जा सकता है
    4. फिर भी अगर flexibility कम पड़े, तो Taylor theorem के अनुसार linear relationship अक्सर nonlinear relationship का अच्छा approximation बन जाता है
    • इन बातों से पूरी तरह सहमत हूं, और linear models को कहीं ज्यादा मान्यता मिलनी चाहिए
      एक और अहम बात यह है कि इंसान, खासकर groups, तर्कसंगत रूप से linear decision-making ही मुश्किल से कर पाते हैं
      कंपनी की दिशा तय करने वाली meeting में आप आखिरकार इसी तरह कह सकते हैं: “advertising spend बढ़ाएं, और discount coupons जैसी दूसरी acquisition costs घटाएं.” “advertising spend बढ़ाने” और “दूसरी costs घटाने” के बीच balance ढूंढना एक सरल linear model ही है
      चाहे आपके पास बेहतरीन nonlinear model हो, असली मुद्दा “interpretability” से ज्यादा actionability है। meeting में regression analysis के नतीजे ले जाएं तो कई strategies को जल्दी model किया जा सकता है और दिशा को लेकर reasonable confidence दिया जा सकता है
      actionable insights को ऊपर तक पहुंचाने में मुझे काफी संघर्ष हुआ, लेकिन regression analysis को ठीक से समझने के बाद काफी जटिल business processes को भी जल्दी खोलकर समझना आश्चर्यजनक रूप से आसान हो गया
    • बिंदु 3 के संबंध में, academic research और industry work के ज्यादातर हिस्से में मैंने generalized additive models को तकनीकी रूप से काफी सफलतापूर्वक इस्तेमाल किया है। यानी वे data पर अच्छी तरह fit हुए
      फिर भी stakeholders ने उन्हें ठीक से समझा या उनका value माना हो, ऐसा कम ही हुआ। मेरी नजर में इसका कारण ज्यादातर आलस और आदत है
    • बिंदु 3 पर कोई उपयोगी reference हो तो जानना चाहूंगा
      literature में अक्सर दिखने वाली समस्या यह है कि authors quadratic term वाले model, जैसे Y = age + age^2, की slope को सबसे कम और सबसे ज्यादा age groups में over-interpret करते हैं। graph में confidence interval नहीं, सिर्फ line देखने पर oldest group में decrease जैसा दिखता है, लेकिन असल में यह quadratic model asymptote को express नहीं कर पाने से पैदा हुई apparent negative slope हो सकती है। उदाहरण: https://www.researchgate.net/figure/Scatter-plot-of-the-quad...)
      जब theory से तय विकल्प न हों, तब मैंने fractional polynomials का इस्तेमाल किया। उदाहरण के लिए x^s में s = {−2, −1, −0.5, 0, 0.5, 1, 2, 3} रखकर, overfitting से बचते हुए सबसे अच्छा fit होने वाला polynomial चुनने की strategy अपनाई: https://journal.r-project.org/articles/RN-2005-017/RN-2005-0...
      यह खराब technique नहीं है, और piecewise polynomial regression या knots जैसे दूसरे तरीके भी आजमाए, लेकिन उदाहरण के लिए knots वाली दो splines के बीच group interaction को कैसे test करें, यह मुझे ठीक से समझ नहीं आया। additive models के साथ भी यही था: https://bookdown.org/ssjackson300/Machine-Learning-Lecture-N...
    • सही नजरिए से देखें तो SVM भी पूरी तरह linear model है, और बहुत reductionist ढंग से कहें तो ReLU neural networks piecewise linear कहे जा सकते हैं
      हालांकि इस तरह की व्याख्या शायद मदद से ज्यादा चीजों को ढक देती है। किसी खास case के लिए सही transformation चुनना बहुत कठिन समस्या है। सवाल बचता है कि sin(x) और x^2 ही क्यों, tanh(x) और x^(1/2) क्यों नहीं
    • मेरी math knowledge बहुत कम है, इसलिए बिंदु 2 चौंकाने वाला है। थोड़ा search करने पर दिखा कि linear model को graph में plot करें तो straight line आनी चाहिए, लेकिन दिए गए example की equation straight line नहीं है
      लगता है मैं कोई बुनियादी बात miss कर रहा हूं
  • regression में सबसे अहम तकनीक intercept को पहचानना है। सुनने में मामूली लगता है और सच में मामूली भी है, लेकिन जब आप terms के बीच interaction जोड़ना शुरू करते हैं तो बात बदल जाती है। मैंने बहुत बार युवा grad students को यहीं गलती करते देखा है
    test score, उम्र (7~16 साल), और binary categorical variable autism diagnosis (0=control group, 1=autism) इस्तेमाल करने वाला एक simple linear model सोचें: score = age + diagnosis + age:diagnosis, यानी score = (X1)age + (X2)diagnosis + (X3)age:diagnosis
    अगर X2 significant है तो भोला student कहेगा “groups में फर्क है!”, लेकिन वह यह बात चूक जाता है कि यह participant के 0 साल का होने पर predicted group difference है। उम्र को mean, median, या बेहतर हो तो जिस उम्र में रुचि है उस पर center करना चाहिए। जब equation में interaction आता है, तो सभी “lower-order” parameter estimates की व्याख्या intercept के आधार पर होती है
    आप यह देखकर कि age effect significant है, सोच सकते हैं कि यह दोनों groups पर लागू होता है, लेकिन X1 केवल reference group यानी control group की predicted slope बताता है। interaction यह test करता है कि दोनों groups की age slopes अलग हैं या नहीं। ऊपर से, interaction significant न भी हो, तब भी autism group का age effect 0 से significantly अलग न हो सकता है। अगर data ambiguous zone में है, तो interpretation में सावधानी चाहिए
    कुछ लोगों को यह obvious लगेगा, लेकिन interaction terms होने पर parameters के conditional space को ठीक से समझने में मेहनत लगती है। यहाँ group coding का तरीका, जैसे overall mean के reference पर है या किसी एक group को reference बनाया गया है, फिलहाल नज़रअंदाज़ किया है, लेकिन सीख वही रहती है। यह समझना ज़रूरी है कि intercept का मतलब क्या है और वह किस/क्या चीज़ की ओर इशारा करता है

    • interaction term वाले models में intuition पकड़ना हमेशा मुश्किल लगता है। आम तौर पर हर response class के लिए model की कौन-सी terms आती हैं, यह लिखकर देखना interpretation में मदद करता है
      इस काम में मदद करने वाला ExploreModelMatrix भी है: https://www.bioconductor.org/packages/release/bioc/html/Expl...
    • अगर ऊपर मैंने कुछ अजीब कहा है तो बता दें। अभी भी सीख रहा हूँ
      अगर आप p-values से नफ़रत करने वाले कट्टर Bayesian हैं तो वह भी ठीक है। बस मैंने बहुत smart students को भी interaction term वाले models को सहज रूप से interpret करने में संघर्ष करते देखा है, और सही दिशा दिखाना चाहता था
    • X1 केवल reference group यानी control group की predicted slope बताता है” कहना सही नहीं है। आपके लिखे equation के हिसाब से X1 पूरे group के लिए value है। आपने proper dummy variables नहीं बनाए
      X1*age*isControl+X2*isControl+X3*isAutism+X4*isAutism*age+X5*age
      ऐसा करने पर ही दोनों groups के age effects और दोनों groups में common age effect को अलग किया जा सकता है
    • यह interpretation सही लगती है
      diagnosis variable X2 का significant loading किसी खास उम्र पर diagnosis effect नहीं बताता। हाँ, उम्र 0 साल पर यह लागू होता है
      model को जिस उम्र में रुचि है उसके आधार पर फिर से center करना चाहिए
  • 10 साल पहले CMU में 36-401 और 36-402 लिए थे, और उस समय Shalizi पढ़ाते थे; दोनों बहुत अच्छे statistics classes थे। अच्छा हो या बुरा, उन्होंने base R सीखवा दिया
    linear regression की बड़ी कमजोरी यह थी कि coefficients को valid तरीके से interpret करने के लिए academic assumptions छोटे teaching datasets में बनाना आसान है, लेकिन messy real-world data पर वे लगभग लागू नहीं होतीं—यह मैंने कठिन तरीके से सीखा

    • यह case पर निर्भर करता है। सबसे महत्वपूर्ण assumption observations की independence है
      अगर यह नहीं है, तो correlated responses को reflect करने के लिए mixed-effects model का इस्तेमाल करना होगा, या responses को average aggregate करना होगा। average निकालने पर variance घटता है, लेकिन data points की संख्या भी घटती है, और Wald test के t-statistic calculation में ये दोनों एक-दूसरे को offset कर देते हैं
      residuals की normality जैसी दूसरी assumptions के मामले में linear models अक्सर कुछ हद तक violations सह लेते हैं। फिर भी यह समझना हमेशा अच्छा है कि ऐसे violations का क्या असर पड़ता है; उदाहरण के लिए simulations चलाकर या null data के p-value histogram देखकर इसे जांचा जा सकता है
    • इसके उलट, messy real-world data में p-value ऐसी है या वैसी है, इस पर अटकने की बजाय अक्सर काफी ठीक-ठाक model ही पर्याप्त होता है
  • मुझे अच्छा लगा कि ridge regression को multicollinearity के context में introduce किया गया है
    आजकल लगता है लगभग सभी इसे overfitting रोकने वाली regularization technique के रूप में सीखते हैं, लेकिन इसके बुनियादी uses में से एक—और शायद origin—मज़बूती से correlated या लगभग linearly dependent predictors के बीच weights को संतुलित तरीके से बांटना है। data काफी हो तब भी ऐसे predictors बड़ी समस्या पैदा कर सकते हैं

  • मैं Citadel के quant researcher जैसे किसी व्यक्ति को linear regression पढ़ाते देखना चाहूँगा। वे इसे कैसे इस्तेमाल करते हैं, खासकर किन बातों की चिंता करते हैं, और क्या कोई theoretical results हैं जो उनके problem देखने के तरीके को meaningful ढंग से बदलते हैं—यह जानने की उत्सुकता है

    • थोड़ा relevant experience है। regularized variants ज़रूरी हैं। samples बहुत कम हैं, और per-sample noise बहुत ज़्यादा है
      related problem covariance matrix estimation में shrinkage estimation variants लोकप्रिय हैं। सबसे सरल Ledoit-Wolf का Linear Shrinkage है
      neural networks को छोड़ दें तो regression करने वाले ज्यादातर लोग domain के हिसाब से ऐसी tweaking जोड़ी हुई linear regression ही इस्तेमाल करते लगते हैं
      खासकर finance में, अधिक complex models से खुद को धोखा देना बहुत आसान है
    • linear regression, वह भी एक predictor वाली regression, मुख्य tool है। जैसे सिर्फ cross-product x'*y काफी नहीं है, inner product x'*x से divide करने पर बिल्कुल सही बैठता है (regression), और इसमें एक और inner product y'*y से फिर divide करें तो square root समेत correlation coefficient बन जाता है, इसलिए कुछ overkill जैसा लगता है
      अफसोस, कोई बड़ा secret या जबरदस्त revelation नहीं है। जैसा Jim Simons ने Numberphile interview में कहा था, यह weak signals को धीरे-धीरे और दर्दनाक तरीके से जमा करने, और system के कई boxes बनाने और सुधारने की process है। इस दौरान interfaces काफी हद तक known होते हैं
      overall picture में fitting method खुद बहुत बड़ा gain नहीं देता। कम से कम उसे बिगाड़े नहीं, इतना काफी है
      मैं Citadel में नहीं था, लेकिन पिछले 20 साल से quant R&D और trading करता रहा हूँ
  • undergrad में कई courses में मुझे linear regression बार-बार फिर से सीखनी पड़ी। बेशक assumptions सही होने की शर्त पर, statistics और probability theory से optimality prove की जा सकती है—यह बात दिलचस्प है
    computer science PhD के दौरान मैंने मुख्यतः deep learning models इस्तेमाल करने वाली regression problems देखीं। सीधे मैंने उन पर काम नहीं किया, लेकिन classical linear models के rigorous proofs और theorems को deep regression models में ले जाने का कोई तरीका हो तो काफी शानदार होगा

  • Shalizi की “Data Analysis from an Elementary Point of View” भी एक अच्छी introductory textbook है: https://www.stat.cmu.edu/~cshalizi/ADAfaEPoV/
    linear models, additive models और simulation पर ज्यादा जोर है, और यही सही दिशा है। किताब का 90% हिस्सा कंप्यूटर के बिना बेकार है, लेकिन आधुनिक वास्तविकता यही है

  • लगता है इस लेख में यह नहीं है, लेकिन linear regression में भी deep learning में अक्सर दिखने वाला double descent phenomenon दिखाई देता है
    इसे देखने के लिए किसी तरह का regularization जोड़ना पड़ता है। अच्छा होगा अगर यह चर्चा भी जोड़ी जाए

    • जानना चाहूंगा कि क्या आप किसी खास paper की ओर इशारा कर रहे हैं। क्या दूसरा descent, neural network की तरह model के overparameterized हो जाने के बाद होता है? यह भी जानना चाहूंगा कि किस तरह का regularization है
  • इस महीने XGBoost से regression पढ़ाने वाले व्यक्ति के तौर पर, यह पढ़ने लायक लेख है। कई academic texts के उलट, यह बहुत अच्छी तरह लिखा गया है और approachable है
    खासकर chapter 6, visual diagnostics, मुझे पसंद आया। यह बहुत अच्छी तरह किया गया है

  • दिलचस्प लग रहा है, क्या किसी को पता है कि इस PDF को mobile-optimized format में कैसे बदला जा सकता है