सब कुछ एक-दूसरे से सहसंबद्ध है (2014–23)
(gwern.net)- सामाजिक विज्ञान और जीवन विज्ञान में लगभग हर variable जोड़ी के बीच किसी न किसी स्तर का सहसंबंध मौजूद होता है
- यह घटना केवल संयोग या सांख्यिकीय त्रुटि नहीं, बल्कि जटिल रूप से उलझे हुए आनुवंशिक और पर्यावरणीय कारकों से उत्पन्न एक वास्तविक तथ्य है
- जैसे-जैसे sample size बढ़ता है, सांख्यिकीय रूप से महत्वपूर्ण सहसंबंध अधिकांश variable जोड़ियों में दिखाई देने लगते हैं, और शोधकर्ता अलग-अलग सहसंबंधों से अधिक पूरे correlation pattern पर ध्यान देने लगते हैं
- ‘Crud factor’ का अर्थ है कि लगभग हर variable जोड़ी में छोटा सहसंबंध मौजूद होता है, और केवल किसी भी theory तथा variable pair के चयन से भी उच्च संभावना के साथ महत्वपूर्ण परिणाम मिल सकते हैं
- ऐसी स्थिति में पारंपरिक significance level (0.05) का अर्थ कमजोर पड़ जाता है, और सामाजिक विज्ञान के statistics की व्याख्या में अधिक सावधानी की आवश्यकता होती है
अवलोकन और पृष्ठभूमि
- मनोविज्ञान और समाजशास्त्र में यह विचार व्यापक रूप से स्वीकार किया जाता है कि “हर चीज़ किसी न किसी हद तक एक-दूसरे से सहसंबद्ध होती है”
- किसी विशेष trait का निर्धारण कई आनुवंशिक और पर्यावरणीय कारकों से होता है, और इन कारकों के बीच भी अपने-आप में सहसंबंध मौजूद रहते हैं
- इसलिए व्यवहार में लगभग हर मापी जा सकने वाली variable में किसी न किसी स्तर की परस्पर संबद्धता होती है
“Crud Factor” और सांख्यिकीय खोजें
- “Crud factor” उस घटना को दर्शाता है जिसमें सामाजिक विज्ञान (और कुछ जीवन विज्ञान) के शोध में मनमानी variable जोड़ियों के बीच भी हमेशा छोटा सहसंबंध मौजूद रहता है
- 1966 में Minnesota के 57,000 हाई स्कूल छात्रों पर किए गए बड़े डेटा अध्ययन में, परिवार, शिक्षा, शौक, करियर, धर्म आदि से जुड़े variables पर 105 crosstabulation विश्लेषण किए गए, और सभी सांख्यिकीय रूप से महत्वपूर्ण निकले
- इनमें से 96% में p<10⁻⁶ स्तर की अत्यंत कम संभावना के कारण संयोग की व्याख्या लगभग अस्वीकार्य थी
- जब variables की संख्या 45 तक बढ़ाई गई, तो कुल 990 संयोजनों में से 92% सांख्यिकीय रूप से महत्वपूर्ण थे
- किसी एक variable का बाकी सभी variables से महत्वपूर्ण संबंधों का median 44 में से 41 था
वास्तविक variables के बीच उदाहरण
- MCAT score का भाई-बहनों की संख्या, जन्मक्रम, लिंग, करियर योजना, धार्मिक पसंद आदि से संबंध देखने पर हर जगह उच्च सांख्यिकीय महत्व मिला
- उदाहरण: छात्राओं के score छात्रों से अधिक थे, भाई-बहनों की संख्या बढ़ने पर score घटने की प्रवृत्ति थी, पहला बच्चा/इकलौता बच्चा सबसे छोटे बच्चे से अधिक बुद्धिमान पाया गया, और धार्मिक समूहों के बीच स्पष्ट अंतर दिखे
- पाँच प्रमुख Protestant denominations के भीतर भी कई variables के साथ उच्च significance वाले संबंध देखे गए
- उदाहरण: इकलौते बच्चे के Presbyterian होने की संभावना Baptist की तुलना में लगभग दोगुनी थी, और denomination के अनुसार स्कूल पसंद तथा करियर आकांक्षाओं में भी कई सहसंबंध दिखे
MMPI प्रश्नों का उदाहरण
- MMPI (personality test) के 550 प्रश्नों में से 507 (92%) में लिंग के आधार पर महत्वपूर्ण अंतर पाया गया
- कुछ प्रश्नों में प्रवृत्ति का अंतर स्पष्ट रूप से समझाया जा सकता है, लेकिन अन्य में कारण जटिल थे या समझाना कठिन था
- चूँकि ये परिणाम बहुत बड़े sample size वाले अध्ययनों में सामने आते हैं, इसलिए ये सांख्यिकीय त्रुटि (type I error) नहीं बल्कि वास्तविक घटनाएँ हैं
सामाजिक विज्ञान के सहसंबंध और theory testing की सीमाएँ
- यदि किसी मनमानी theory और variable pair को random तरीके से जोड़ा जाए, और औसत सहसंबंध (crud factor) 0.30 के आसपास हो, तो व्यवहार में लगभग हर तीन में से एक बार महत्वपूर्ण अंतर मिलने की संभावना रहती है
- यह सामाजिक विज्ञान में आम तौर पर सार्थक माने जाने वाले significance level (0.05) की अपेक्षा कहीं अधिक बार घटित होता है
- क्योंकि शोधकर्ता द्वारा सैद्धांतिक रूप से अपेक्षित न किए गए variable pairs में भी सहसंबंध आसानी से मिल जाते हैं, इसलिए केवल सांख्यिकीय महत्व के आधार पर वास्तविक causality का समर्थन करना कठिन हो जाता है
- जटिल कारणों (gene/environment) और observational data की प्रचुरता से ऐसे बहुआयामी सहसंबंध पैदा होते हैं
व्यावहारिक निष्कर्ष
- सामाजिक विज्ञान के data की व्याख्या और theory testing करते समय, ‘crud factor’ से पैदा होने वाले “सामान्य लेकिन वास्तव में मौजूद सहसंबंधों” को हमेशा ध्यान में रखना चाहिए
- significance statistics (जैसे p<0.05) पर अंधविश्वास करने के बजाय, variables के बीच वास्तविक causality और pattern interpretation पर अधिक ध्यान देने की आवश्यकता है
- Thorndike के इस कथन की तरह कि “सभी अच्छी चीज़ें साथ आने की प्रवृत्ति रखती हैं”, वास्तविक दुनिया में बहुत-सी चीज़ें एक-दूसरे में गहराई से उलझी हुई हैं
1 टिप्पणियां
Hacker News की राय
यह उन बातों में से एक पर चर्चा है जो मुझे सबसे ज़्यादा खटकती हैं
लोग अक्सर "statistically significant" का मतलब "ध्यान देने लायक/अर्थपूर्ण" समझ लेते हैं
वे कोई मापा गया अंतर देखते हैं और मान लेते हैं कि statistics कह रही है कि यह 'महत्वपूर्ण' है, जबकि यह गलत तरीका है
वास्तव में significance testing सिर्फ़ यह बताता है कि देखा गया अंतर 'अच्छा measurement' होने की कितनी संभावना रखता है
यानी, किसी भरोसे के स्तर के साथ हम यह कह सकते हैं कि "यह अंतर वास्तव में मौजूद है"
लेकिन मापा गया अंतर मूल्य-निर्णय की दृष्टि से भी 'अर्थपूर्ण' है या नहीं, यह अलग से तय करना पड़ता है, और यह ज़्यादातर अंतर के आकार पर निर्भर करता है
यह बहुत obvious लगता है, लेकिन industry और कई scientific fields में यह गलती बेहद आम है
उदाहरण के लिए, "इस intervention ने [metric] में p<0.001 के साथ बदलाव किया, कितना significant है! बदलाव का आकार 0.000001% है"
ऐसे मामलों में यह फिर से सोचना चाहिए कि क्या यह सचमुच 'अर्थपूर्ण' है
लेकिन उदाहरण पर मैं थोड़ा जोड़ना चाहूँगा
बहुत छोटा p-value हमेशा 'meaningful' effect नहीं बताता, लेकिन उसका effect size से कोई संबंध नहीं है, ऐसा भी नहीं है
p-value अपने आप में (effect size)/(noise/√sample size) से निकलता है
यानी, बड़ा test statistic छोटे p-value की ओर ले जाता है
बहुत छोटा p-value आम तौर पर बड़े effect या बहुत बड़े sample size (n) से आता है
इसलिए बहुत बड़े N पर ही बहुत छोटे effect के साथ p<0.001 आ सकता है
लेकिन वास्तविक research में, अगर p<0.001 आता है, तो sample size की सीमाओं के कारण effect के वास्तव में बड़ा होने की संभावना भी काफ़ी होती है
इसमें कहा गया है कि statistical significance परिणाम का सबसे कम दिलचस्प हिस्सा है, और ज़ोर दिया गया है कि परिणामों को effect size के ज़रिए समझाया जाना चाहिए
सिर्फ़ यह नहीं कि treatment असरदार है या नहीं, बल्कि यह कि वह 'कितना' असरदार है
– Gene V. Glass
लेकिन इसे सिर्फ़ एक 'pet peeve' कहना कम होगा; मैं इसे statistics को लेकर रोगग्रस्त गलतफ़हमी मानता हूँ
ऐसी गलतफ़हमी, खासकर लोकप्रिय health/wellness media में, गलत निष्कर्षों तक ले जा सकती है
health और nutrition से जुड़ी studies को statistically significant बताया जाता है, जबकि वास्तविक effect अक्सर बहुत मामूली होता है
फिर लोग सिर्फ़ ऐसे नतीजों के आधार पर अपनी ज़िंदगी और आदतों में बड़े बदलाव कर लेते हैं, जबकि उसके लिए पर्याप्त आधार नहीं होता
इससे भी बुरा तब होता है जब पहले से test करने के लिए hypothesis तय नहीं की जाती, और पुराने data को खंगालकर सिर्फ़ 'statistically significant' correlations खोज निकाले जाते हैं
इसमें सुझाव दिया गया है कि significance को probability update करने के तरीके के रूप में सोचना चाहिए
तर्क यह है कि एक test (या study) probability को X% तक update करता है, इसलिए 'अर्थपूर्ण' निर्णय तक पहुँचने के लिए आम तौर पर और experiments की ज़रूरत होती है
यह सच में बहुत typical "rationalist" शैली का लेख है
statistical phenomena पर कुछ सही observations के साथ-साथ इसमें अजीब राजनीतिक वाक्यांश भी बिखरे हुए हैं
उदाहरण के तौर पर: "सैद्धांतिक और अनुभवजन्य विचार 'algorithmic bias' या 'protected groups' पर causal inference को लेकर संदेह पैदा करते हैं: exclusion न करना वांछनीय न हो सकता है, और यह असंभव या निरर्थक भी हो सकता है"
यह बहुत अजीब वाक्य है, और बिना संदर्भ के अचानक आ जाता है
ऐसा लगता है जैसे बात यह कहने की हो कि कोई hidden latent variable criminality तय करता है, इसलिए black box (parole model) में "is_black" का उपयोग ठीक है; मुझे यह बेतुका लगता है
दरअसल model कैसे काम करता है, इस पर रुचि statistical interpretation से भी गहरा मुद्दा है
model selection की प्रक्रिया में freedom बहुत ज़्यादा हो जाए, तो किसी भी नतीजे को निकालने के लिए design किया जा सकता है
उदाहरण के लिए, अगर parole model में "likes_hiphop" जैसा variable है, तो यह देखना चाहिए कि वह वहाँ क्यों है और क्या वह वास्तव में 'optimal model' था
आखिरकार, social phenomena में variables के बीच इतनी correlations होना याद दिलाता है कि कोई भी model कम से कम आंशिक रूप से राजनीतिक उत्पाद हो सकता है
"सैद्धांतिक और अनुभवजन्य विचार" वाला वाक्यांश ऊपर की चर्चा की ओर इशारा करता है
यानी, क्योंकि हर चीज़ किसी न किसी तरह correlated है, इसलिए सिर्फ़ correlation देखकर यह पक्का नहीं कहा जा सकता कि उसका कोई मूलभूत अर्थ है
social scientists जटिल models बनाते हैं, बहुत सारे variables देखते हैं, और अपनी hypotheses को support करने वाली correlations ढूँढते हैं, लेकिन यह तर्क है कि ऐसी correlations हर जगह मिल सकती हैं, इसलिए वे वास्तविक evidence के रूप में कमज़ोर हैं
और यह भी ज़रूरी नहीं कि model ने सचमुच "is_black" जैसे variable का उपयोग किया हो
सिर्फ़ इसलिए कि कोई black box model काले लोगों के लिए प्रतिकूल नतीजे देता है, यह नहीं मान लेना चाहिए कि उसमें सचमुच 'is_black' variable शामिल था
खासकर genetics, IQ जैसे विषयों में, वे अक्सर कमज़ोर research और data के आधार पर निष्कर्ष निकालते दिखते हैं
मेरा मानना है कि social science modeling में सैद्धांतिक पृष्ठभूमि ज़रूरी है, लेकिन मुझे संदेह है कि TFA भी किसी विशेष राजनीतिक मुद्दे पर यही रुख रखेगा या नहीं
उदाहरण के लिए, अल्पसंख्यक समूहों के लिए किसी organization की hiring में अगर "is_white" variable इस्तेमाल हो, तो क्या वही बात कही जाएगी?
उनका अंदाज़ ऐसा है कि वे अपनी smartness का माहौल बनाते हैं और बिना ठोस आधार के अटकलों को तथ्य की तरह पेश कर देते हैं
खासकर scaling/AI community में gwern को लेकर असामान्य उत्साह भी मुझे अजीब लगता है
अफ़सोस है कि लेख में The Hitchhiker's Guide to the Galaxy का वह मशहूर quote नहीं आया
इससे वही संदेश याद आता है कि "ब्रह्मांड का हर पदार्थ किसी न किसी तरह हर दूसरे पदार्थ को प्रभावित करता है, इसलिए सिद्धांततः fairy cake के एक टुकड़े को देखकर पूरे ब्रह्मांड, सूरज, ग्रहों, कक्षाओं और सामाजिक-आर्थिक इतिहास तक का अनुमान लगाया जा सकता है"
अलग-अलग T_zero संरचनाएँ T_current (वर्तमान अवस्था) से जुड़ सकती हैं, और एक जैसी भौतिक संरचना होने पर भी उससे पहले की "universe-cake" स्थिति अलग हो सकती है
और यह पूरी तरह deterministic system मानकर चलता है
संबंधित विवरण लिंक
पहले लोग statistics के बिना भी दुनिया की सच्चाइयाँ खोज लेते थे
statistics आने के बाद यह एक उपयोगी tool ज़रूर बना, लेकिन इसके दुरुपयोग से मूर्खता को बुद्धिमत्ता की तरह पेश करने की समस्या भी बढ़ी है
इसलिए यह 'correlation noise' वाला अवलोकन सवाल उठाने लायक है
सबसे बढ़कर, logic और domain की बुनियादी समझ पहले आती है
सिर्फ़ numbers गिनना गलतफ़हमी पैदा कर सकता है
सिर्फ़ logic से नया ज्ञान नहीं सीखा जा सकता
logic सिर्फ़ पहले से ज्ञात बातों को दोबारा व्यक्त करता है, और बुनियादी ज्ञान के लिए अनुभव या experiment चाहिए
क्योंकि वास्तविक दुनिया का observation हमेशा अपूर्ण होता है, statistical interpretation अनिवार्य है
statistics से पहले या तो (a) अमीर लोग बैठकर दुनिया पर गहरा विचार करते थे, (b) करिश्माई लोग अपनी इच्छा के मुताबिक उपदेश देते थे, या (c) कोई smart व्यक्ति कभी-कभार सही निकल जाता था
statistics ने यह संभव बनाया कि कोई भी व्यक्ति परिणामों के आधार पर सही-गलत का आकलन कर सके, और यह सिर्फ़ elites तक सीमित न रहे
बेशक statistical inference की एक खूबी 'intercomparison' भी है, यानी प्रक्रिया की पूरी समझ बिना भी अंतर के आधार पर निष्कर्ष निकाला जा सकता है
लेकिन यही वजह है कि इसमें manipulation या misunderstanding भी आसान हो जाती है
संबंधित वीडियो
विषय से हटकर, लेकिन यह blog सच में बहुत सुंदर लगा
drop cap, स्क्रीन के दाहिने तरफ़ दिखने वाले inline comments, progress bar—इन सबमें project के प्रति लगाव झलकता है
यह लेख सच में बहुत विशाल है
मुझे भी इच्छा होती है कि मैं कभी ऐसा गंभीर और ठोस लेख लिख सकूँ
लेखक की दूसरी रचनाएँ भी देखें तो लगता है मानो वह मशीन की तरह लगातार लिखते रहते हैं
हाँ, अगर कोई आर्थिक सहयोग भी कर दे तो और अच्छा
इस तरह की बहसें दशकों से चल रही हैं
आलोचनात्मक नज़रिया बनाए रखना ज़रूरी है
लेकिन व्यक्तिगत रूप से, काम में इस तरह की तर्क-प्रणाली से जूझते-जूझते मुझे यह अक्सर बहुत उपयोगी नहीं बल्कि कुछ हद तक खोखला लगा है
'crud' statistical cosmic microwave background की तरह patterns में मौजूद है, और उसे पूरी तरह निरर्थक मानकर खारिज करना ठीक नहीं; कभी-कभी वह महत्वपूर्ण भी हो सकता है
कभी variables के बीच संबंध आसानी से समझ में नहीं आते, तो कभी वही संभावित confounders को समझने की कुंजी बनते हैं जिन्हें control करना ज़रूरी है
हर चीज़ हमेशा correlated नहीं होती; सच में ऐसे मामले भी होते हैं जहाँ संबंध 0 होता है
'0 से अलग meaningful effect size' तय करना भी बहुत हद तक मनमाना और subjective है
मुझे लगता है इस phenomenon को देखने के लिए कोई अधिक productive framework होना चाहिए
Correlated. कोई और उदाहरण?<i>Everything Is Correlated</i> - पुरानी चर्चा
यही वजह है कि experimental science, observational studies से अलग होती है
statistical analysis सिर्फ़ इतना कारण देता है कि किसी hypothesis पर थोड़ा अधिक भरोसा किया जाए; उसे वास्तविक experimental approach से मज़बूत करना पड़ता है
blog के ज़्यादातर उदाहरण medicine, social science, behavioral science जैसी जगहों से हैं, जहाँ ठीक से controlled experiments कठिन होते हैं या sample size कम होने से causality साफ़ करना मुश्किल होता है
बेशक design की विफलता analysis से ठीक नहीं की जा सकती (You can’t fix by analysis what you bungled by design - source), लेकिन यह कम से कम bias घटाने की दिशा है
लेख के इस quote पर: “इससे significance testing का अर्थ धुँधला हो जाता है; यह बस ऐसे scenario में data की probability को बहुत सटीकता से गणना करना है जिसके a priori झूठे होने का हमें पहले से पता है”
मुझे लगता है अर्थपूर्ण परिणाम तक पहुँचने के लिए model को सरल बनाना, और सख्ती से कहें तो उसके पूरी तरह सच न होने को स्वीकार कर गणना करना, बहुत आम बात है
जैसे Newton के laws, electric circuit analysis भी simplification के कारण संभव हैं, और banking में भी कभी 1 साल को 360 दिन मानकर गणना की जाती थी
अगर यह व्यवहार में अच्छी तरह काम करता है, तो मुझे समझ नहीं आता कि मैं क्या चूक रहा हूँ
अगर research को सत्य की खोज माना जाए, तो यह एक गंभीर दुविधा है
(जैसे 1 महीने से कम की अवधि के भुगतान की गणना)
दूसरे शब्दों में, Einstein को Newton का refined version कहा जा सकता है
जैसे special relativity कम गति की सीमा में Newtonian motion पर converge करती है
वास्तव में statistics में 'झूठ' जैसी चीज़ नहीं होती; इसे "x% संभावना है कि यह सच नहीं है" के रूप में समझना चाहिए
अगर x को कम करना है, तो 'और ज़्यादा statistics' करनी होगी, और sample size (N) बढ़ाना सबसे भरोसेमंद तरीका है
लेख की बड़ी गलती यह है कि वह मान लेता है कि पर्याप्त बड़ा N मिल जाए तो truth/falsehood को बिल्कुल निरपेक्ष की तरह लिया जा सकता है
क्योंकि तब संभावना उस स्तर तक पहुँच जाती है जहाँ 'अगर ब्रह्मांड दस लाख बार बने तो शायद एक बार' जैसा मामला हो
लेकिन वास्तविकता में social science, medicine, economics आदि के ज़्यादातर अध्ययन बहुत छोटे N पर काम करते हैं, इसलिए statistical समस्याएँ अनिवार्य रूप से बड़ी रहती हैं
इसलिए लोग 'और ज़्यादा statistics' करने की कोशिश करते हैं, लेकिन व्यवहार में वे N नहीं बढ़ा पाते और या तो numbers को मोड़ते हैं, या N थोड़ा बढ़ाकर दावा करते हैं कि समस्या हल हो गई