दस लाख में एक संभावना वाली चीज़ क्या है? (2010)
(stat.berkeley.edu)- “दस लाख में एक संभावना” जैसी आम अभिव्यक्ति सचमुच लागू होती है या नहीं, इसे सिक्का उछालना, लॉटरी, भूकंप, चुनाव और व्यक्तिगत जोखिम जैसे मामलों को गणना योग्य घटनाओं में बाँटकर परखा गया है
- probability, intuition से ज़्यादा denominator और time unit पर निर्भर करती है, और उसी घटना का आकलन भी “कौन”, “कब” और “कितनी देर” को आधार मानने पर बदल जाता है
- 20 बार सिक्का उछालने पर हर बार tails आना, 1 साल तक हर हफ्ते 6 California Powerball टिकट खरीदकर जीतना, Hayward fault पर 50 मिनट के भीतर बड़ा भूकंप आना, और अमेरिका में अगले 2.4 करोड़ नवजातों में से एक का राष्ट्रपति बनना, ऐसे उदाहरण हैं जो लगभग दस लाख में एक के करीब आते हैं
- व्यक्तिगत जोखिम को देखते समय गतिविधि में भाग लेने वालों की संख्या और exposure time, दोनों को साथ में देखना चाहिए; ski resort में 1 दिन की यात्रा के दौरान मौत लगभग 1 micromort के करीब है, लेकिन एक skydiving jump में मौत लगभग 10 micromort है, इसलिए वह इस दायरे से बाहर है
- जनसंख्या-औसत probability को किसी खास व्यक्ति पर सीधे लागू करना मुश्किल है, और lightning death, homicide, या पुरुष breast cancer जैसे मामलों में व्यवहार, environment और family history के कारण अंतर बड़ा होता है, इसलिए सीधी तुलना उचित नहीं है
“दस लाख में एक” को वास्तविक घटनाओं से परखना
- कक्षा में छात्रों से पूछा जाता है कि रोज़मर्रा की बातचीत में “1 in a million chance” सुनते ही उनके मन में क्या आता है, और इस तरह लॉटरी जीतने या lightning strike जैसी सामान्य मिसालों से लेकर अधिक कल्पनाशील उदाहरणों तक की सूची बनती है
- रोज़मर्रा के उपयोग में इस अभिव्यक्ति का इस्तेमाल कैसे होता है, यह देखने का व्यावहारिक तरीका लगभग ब्लॉग खोज तक सीमित है
- इसके बाद देखा जाता है कि छात्रों द्वारा सुझाई गई घटनाएँ सचमुच दस लाख में एक के करीब हैं या नहीं, और क्या उन्हें मोटे तौर पर 2 गुना त्रुटि-सीमा के भीतर मात्रात्मक रूप से आँका जा सकता है
अपेक्षाकृत स्पष्ट गणना वाले खेल और random sample के उदाहरण
- probability games या random sampling में शर्तें साफ़ होती हैं, इसलिए गणना सीधी रहती है
- अगर मैं 20 बार सिक्का उछालूँ और हर बार tails आए, तो YES
- अगर मैं 1 साल तक हर हफ्ते 6 California State Powerball टिकट खरीदूँ और मौजूदा गेम में जीत जाऊँ, तो YES
- अगर 6 प्रसिद्ध लोगों को चुनकर Wikipedia के “random article” लिंक पर जाएँ और उनमें से कोई एक निकल आए, तो YES
- लेकिन अगर सिक्का उछालने वाला “मैं” नहीं बल्कि “आप” हों, तो जब तक मुझे इस बात का बहुत पक्का भरोसा न हो कि आप चालाकी नहीं कर सकते, पहला उदाहरण NO हो जाता है
समय और स्थान की शर्तों से बदलती probability: भूकंप और चुनाव
- Berkeley की कक्षा के पास स्थित Hayward fault पर अगले 50 मिनट के भीतर 6.7 से बड़ा भूकंप आना YES है
- 2007 के अनुमान में Hayward fault पर बड़े भूकंप की वार्षिक संभावना लगभग 1% मानी गई थी
- कक्षा fault line से कुछ सौ yard दूर है, और कक्षा की अवधि अक्सर 50 मिनट होती है, इसलिए यह गणना लगभग मेल खाती है
- Seattle के पास Cascadia subduction zone में अगले 5 घंटे के भीतर विनाशकारी भूकंप आना भी YES है
- opinion polls में बहुत करीबी California statewide election में निर्णायक वोट डालना भी YES है
- इसकी probability लगभग 13/N मानी जाती है, जहाँ N कुल वोटों की संख्या है
- 2016 के California presidential election में कुल वोट लगभग 1.4 करोड़ थे
राष्ट्रपति बनने वाला नवजात और correlation का जाल
- अमेरिका में आगे जन्म लेने वाले 2.4 करोड़ बच्चों में से एक का राष्ट्रपति बनना YES है
- अमेरिका में जन्मदर अभी लगभग 40 लाख प्रति वर्ष है
- अगर मानें कि एक राष्ट्रपति औसतन लगभग 6 साल तक पद पर रहता है, तो 6 साल में जन्म लेने वाले लगभग 2.4 करोड़ बच्चों में से एक कभी न कभी राष्ट्रपति बनेगा
- लेकिन किसी खास kindergarten class के 24 बच्चों की ओर इशारा करके यह कहना कि उनमें से एक के राष्ट्रपति बनने की संभावना दस लाख में एक है, गलत है
- क्योंकि इसमें समुदाय की socioeconomic status जैसे कारकों के साथ correlation होता है
व्यक्तिगत जोखिम में भागीदारी और exposure time सबसे अहम
- plane crash में मौत, pirates द्वारा kidnapping, rip current में डूबना, या Latin America में car accident से मौत जैसे सवालों का आसान सीधा जवाब नहीं होता
- स्वैच्छिक गतिविधियों के जोखिम को समझने के लिए केवल मौतों की संख्या नहीं, बल्कि उस गतिविधि में भाग लेने वाले लोगों की संख्या और उस पर बिताया गया समय भी चाहिए
- ski और snowboard का उदाहरण अर्थपूर्ण data format दिखाता है
- अमेरिका में हर 10 लाख आधिकारिक ski resort visits पर ski या snowboard से औसतन लगभग 0.7 मौतें होती हैं
- इसलिए आधिकारिक ski resort में 1 दिन की यात्रा के दौरान ski या snowboard दुर्घटना से मौत YES है
- इस तरह का निर्णय पिछले data पर आधारित population average, यानी statistical probability, के अधिक करीब है
micromort और व्यक्ति-विशेष जोखिम का अंतर
- micromort वह इकाई है जिसका उपयोग तब किया जाता है जब किसी खास गतिविधि से मृत्यु की संभावना दस लाख में एक हो
- skydiving jump के दौरान मौत NO है
- यह लगभग 10 micromort के करीब है, इसलिए दस लाख में एक से बड़ी है
- population average को किसी खास व्यक्ति पर लागू किया जा सकता है या नहीं, यह सामान्य समझ की शर्तों के साथ देखना चाहिए
- व्यक्तियों के बीच variability जितनी अधिक होगी, population average उतनी ही कम प्रासंगिक होगी
- अमेरिका में “आप” के अगले 8 दिनों के भीतर हत्या का शिकार होने की संभावना NO है
- क्योंकि यह मानना उचित है कि आप ऐसी गतिविधियों में शामिल नहीं हैं जो homicide risk को अपेक्षाकृत बढ़ाती हैं
- California में 200 mile की car trip के दौरान मौत YES है
- California में मृत्यु दर लगभग हर 10.5 करोड़ vehicle miles पर 1 मौत है
- इसमें यात्रियों की संख्या और औसत से बेहतर driving को ध्यान में रखकर मान समायोजित किया गया है
lightning और पुरुष breast cancer से समझ की सीमाएँ
- lightning strike होना NO है
- “lightning strike होना” खुद एक ऐसी घटना है जिसके लिए विश्वसनीय data पर्याप्त नहीं है
- medical treatment न मिले तो मामला आधिकारिक आँकड़ों में दर्ज नहीं होता, और यह अलग करना भी कठिन हो सकता है कि बिजली पेड़ पर गिरी या किसी व्यक्ति पर
- अमेरिका में lightning death का data अपेक्षाकृत अच्छा है, लेकिन हाल के वर्षों का औसत लगभग 30 मौत प्रति वर्ष है
- population average के हिसाब से वार्षिक मृत्यु-जोखिम लगभग 1 करोड़ में 1 है
- lifetime risk लगभग 1.5 लाख में 1 है
- lightning risk व्यक्ति के व्यवहार के अनुसार बहुत बदलता है
- जो लोग thunderstorm के समय बाहर नहीं रहते, उनका जोखिम कम होता है
- मौतें अनुपात से अधिक युवा पुरुषों में होती हैं
- किसी व्यक्ति की probability को 2 गुना त्रुटि-सीमा के भीतर आँकने का कोई तरीका नहीं है
- युवा पुरुष में lifetime breast cancer होना NO है
- पुरुष breast cancer दुर्लभ है, लेकिन छात्रों की कल्पना जितना दुर्लभ नहीं
- lifetime incidence लगभग 1,000 में 1 है, और मृत्यु लगभग 5,000 में 1
- family history के अनुसार व्यक्ति-विशेष संभावना बदल सकती है, लेकिन यह दस लाख में एक से बहुत अधिक है
बीमारी और आदतों के प्रभाव के लिए microlife अधिक उपयुक्त
- बीमारी, smoking, obesity जैसी चीज़ों के प्रभाव को केवल मृत्यु-प्रायिकता से देखने के बजाय microlife में समझना अधिक उपयुक्त है
- microlife जीवन-प्रत्याशा में 30 मिनट के बदलाव के बराबर होता है
- 30 मिनट, एक वयस्क जीवनकाल के लगभग दस लाखवें हिस्से के बराबर समय है
2 टिप्पणियां
Hacker News की टिप्पणियां
“वैज्ञानिकों ने गणना की कि इतनी साफ़ तौर पर बेतुकी चीज़ के सचमुच मौजूद होने की संभावना दस लाख में एक है।
लेकिन जादूगरों ने गणना की कि दस लाख में एक संभावना दस में से नौ बार घटित होती है।” — Terry Pratchett
यह उस बात का मज़ाक उड़ाने वाला वाक्य है कि उपन्यासों में जब कोई कहता है, “यह दस लाख में एक संभावना है, लेकिन शायद हो जाए!”, तो आखिरकार वह सफल हो जाता है
Guards! Guards! में, ड्रैगन की कमज़ोरी को तीर से भेदना ही काफी नहीं है; संभावना को ठीक-ठीक दस लाख में एक बनाने के लिए हर तरह की बेहूदा शर्तें जोड़नी पड़ेंगी, ऐसी गणना की जाती है
क्योंकि, जैसा लेख में दिखता है, ठीक दस लाख में एक संभावना बनाना अपने-आप में मुश्किल है
हालांकि कोई सही-सलामत cheese seller चीज़ काटने के बाद उसकी परतों को फिर से मिलाएगा नहीं, इसलिए सोचने का यह तरीका दोषपूर्ण लगता है
इसलिए दस लाख में एक संभावना हमेशा घटित होती है https://www.aviationfile.com/swiss-cheese-model/
https://markxu.com/strong-evidence याद आता है
“एक बार किसी ने मेरा नाम पूछा। मैंने जवाब दिया, ‘Mark Xu’। उसके बाद उस व्यक्ति ने शायद मान लिया होगा कि मेरा नाम ‘Mark Xu’ है। शायद वह इस बात पर 20:1 odds की शर्त भी खुशी-खुशी लगा लेता कि मेरे driver’s license पर ‘Mark Xu’ लिखा है।
किसी का नाम ‘Mark Xu’ होने की prior probability, उदारता से देखें तो भी 1:1,000,000 है। अगर posterior odds 20:1 हैं, तो मेरे ‘Mark Xu’ कहने का likelihood ratio 20,000,000:1 है, यानी लगभग 24 bits of evidence। यह काफी बड़ा evidence है।”
“असाधारण दावों के लिए असाधारण evidence चाहिए, लेकिन असाधारण evidence हमारी सोच से ज्यादा आम हो सकता है।”
नाम पहले ही बता दिया गया है, तो कोई ऐसी बेतुकी शर्त क्यों पेश करेगा—जब तक उसके पास नाम के बारे में कोई खास जानकारी न हो, यह अजीब है
बेशक अगर YouTube prank channel की संभावना भी सोचें, तो reactions पाने के लिए सचमुच जीतने का मौका देने वाली स्थिति भी संभव है
Mark बहुत आम नाम है, और Xu Wikipedia के हिसाब से एक चीनी surname है जिसे एक करोड़ से ज्यादा लोग इस्तेमाल करते हैं
इस combination वाला नाम रखने वाला कोई व्यक्ति है, यह बिल्कुल भी असाधारण नहीं है
0.95 को दस लाख से गुणा क्यों नहीं करते? वही logic लगाएं तो मेरे username के quickthrower2 होने पर मैं infinite odds भी स्वीकार कर सकता हूं, तो क्या information amount भी infinite हो जाएगा?
उदाहरण के लिए मान लें Mark कहता है, “मैंने 1 से 1 अरब के बीच कोई संख्या सोची और लिख दी है, और जो संख्या मैंने लिखी है वह 6,822,172 है”
मैं कहता हूं, “ठीक है”, तो Mark कहता है, “ओह, तुम मानते हो? तो शर्त लगाते हैं। अगर मैंने 6,822,172 लिखा है तो तुम जीतोगे, और अगर 1 से 1 अरब के बीच कोई दूसरी संख्या लिखी है तो मैं जीतूंगा” — क्या मैं वह शर्त लूंगा? शायद शक होगा
और Mark यह नहीं कह सकता कि “Recursing भविष्यवाणी करता है कि वह क्यों मुझ पर भरोसा नहीं करेगा और खुशी-खुशी वह शर्त लेगा। इसलिए उसका शर्त लेना इस बात का बहुत मजबूत evidence है कि मैंने सचमुच 6,822,172 लिखा है”
दूसरे व्यक्ति के व्यवहार की भविष्यवाणी को evidence के रूप में इस्तेमाल नहीं किया जा सकता
हालांकि ‘X’ की information amount काफी ज्यादा है
निम्न सभी गतिविधियों में मृत्यु की संभावना लगभग दस लाख में एक, यानी 1 micromort है
मोटरसाइकिल से 6 मील (9.7km) यात्रा, पैदल 17 मील (27km) चलना, साइकिल से 20 मील (32km) चलना, कार से 230 मील (370km) यात्रा, जेट विमान से 1,000 मील (1,600km) यात्रा, ट्रेन से 6,000 मील (9,656km) यात्रा
फिर भी छोटी दूरी की यात्राओं में कार की जगह साइकिल लेने पर स्वास्थ्य लाभों के कारण जीवन प्रत्याशा बढ़ती है
स्रोत: https://en.wikipedia.org/wiki/Micromort https://www.ncbi.nlm.nih.gov/pmc/articles/PMC2920084/
लेख में California में कार से 200 मील चलाने पर मृत्यु की संभावना दस लाख में एक मानी गई है, तो मोटे तौर पर यही आंकड़ा पूरे देश पर लागू करें तो Chicago-LA ड्राइव में मृत्यु की संभावना 1 लाख में 1 हो जाती है
राउंड ट्रिप करने पर यह दो बार होगा, यानी 50,000 लोगों में 1 Chicago-LA की आने-जाने वाली रोड ट्रिप में मरता है; यह काफी डरावना लगता है
अमेरिका में औसतन रोज़ 100 से अधिक लोग कार ट्रैफिक में मरते हैं
यह गणना गंभीर चोट, स्थायी विकलांगता, रीढ़ की हड्डी का फ्रैक्चर, अंग कटना, अंधापन, पूरे शरीर में third-degree burns जैसी चीज़ों को छोड़कर केवल मृत्यु को देखती है
आधुनिक चिकित्सा की वजह से ऐसी क्षति मरने से अधिक आम हो सकती है
कारें बहुत खतरनाक हैं, और हम ड्राइविंग का मतलब क्या है इसे कम करके आंकते हैं
अगर कार-केंद्रित मुख्य सड़क के बगल में हैं तो मौत तय-सी है, और अगर ग्रामीण सड़क पर कारों से ज्यादा साइकिलें हैं तो यह कहीं ज्यादा सुरक्षित है
“दस लाख साल में भी न होने वाली बात” जैसी कोई घटना, जो किसी एक व्यक्ति के लिए दस लाख साल में एक बार हो सकती है, पूरी पृथ्वी की आबादी के हिसाब से हर साल 8,000 से अधिक बार होती है
उनमें से बहुतों के पास कैमरे वाले स्मार्टफोन हैं, इसलिए quick brown fox का lazy dog के ऊपर से कूदने का असली वीडियो भी मौजूद है
फिर भी मेरा पसंदीदा इसे पार नहीं कर पाता: https://www.thewestmorlandgazette.co.uk/news/6922546.bull-br...
“एक लहर आई।”
“लहर आई?”
“लहर ने जहाज़ को मारा।”
“क्या यह कोई अनोखी बात है?”
“ओह, समुद्र में? दस लाख में एक संभावना है!”
https://www.youtube.com/watch?v=3m5qxZm_JqM
Becker Bottle मुझे सच में बहुत पसंद आया
यह इस concept को सचमुच visualize करने देता है, इसके साथ खेलना भी बहुत मज़ेदार है, और chemistry class के learning tool के रूप में भी बेहतरीन है
https://www.flinnsci.com/becker-bottle-one-in-a-million/ap45...
EU में घरों, दफ्तरों और सामान्य इमारतों के लिए structural engineering safety factor कैसे इस्तेमाल होते हैं, यह जानना रोचक हो सकता है
Eurocode CC1, CC2, CC3 नाम के तीन consequence classes परिभाषित करता है
CC1 सबसे कम परिणाम वाला वर्ग है, जो सामान्य घरों, light industry और agriculture में इस्तेमाल होता है, और structural collapse से मृत्यु की संभावना कम—0.001—मानी जाती है
CC2 इमारतें (apartments, offices, hotels आदि) मध्यम स्तर 0.03 पर हैं, और CC3 बड़े stadium जैसे विशेष भवन हैं, जिनमें structural collapse पर मृत्यु जोखिम अधिक—0.3—परिभाषित है
आर्थिक और सामाजिक विचार जैसे अन्य तत्व भी consequence class तय करने में शामिल होते हैं
consequence class उस संभावना से जुड़ता है जिसे किसी खास वर्ष में इमारत के गिरने पर स्वीकार्य माना जाता है, और कारण extreme weather आदि कुछ भी हो सकता है
CC1 के लिए 1/100, CC2 के लिए 1/10,000, CC3 के लिए 1/100,000 है
इसलिए केवल structural safety standards के आंकड़ों को देखें, तो तेज तूफान के दौरान stadium में structural collapse से कम-से-कम एक व्यक्ति की मृत्यु की संभावना प्रति वर्ष 300,000 में 1 हो सकती है
ये statistics हवा, बर्फ, बारिश, live load आदि के सरल benchmark values और आसान safety factors में map किए जाते हैं; उदाहरण के लिए CC2 सभी variable loads के लिए 1.5 safety factor रखता है
नीचे वाली submission के लगभग साथ-साथ दिखा, इसलिए मज़ेदार लगा
शायद दोनों एक-दूसरे का जवाब हो सकते हैं
“Q: दस लाख में एक संभावना किसकी है?”
“A: https://news.ycombinator.com/item?id=38907620”
मुझे वह समय याद आया जब मैं बहुत भारी traffic वाली service चला रहा था
दिलचस्प बात यह थी कि उस स्तर के traffic पर edge cases कितनी बार होते थे
जो चीज़ local में reproduce करना सचमुच मुश्किल होती थी, वह logs में हफ्ते में 100 बार हो जाया करती थी
यह सच में शानदार है
यह आपको 1 और 0 की random sequence खुद चुनने देता है, फिर दिखाता है कि वह कितनी गैर-random है
https://calmcode.io/blog/inverse-turing-test.html
10 fail हुआ, 110 pass हुआ
शायद मैं काफी random हूँ?
किसी व्यक्ति का नाम 'Mark Shi' होने की संभावना को बहुत उदारता से 1:1,000,000 मान लें।
मैंने 'Mark Shi' कहा — इसकी संभावना का अनुपात 20,000,000:1 है, यानी लगभग 24 bits का evidence।
असाधारण दावों के लिए असाधारण सबूत चाहिए, लेकिन असाधारण सबूत हमारे सोचने से ज़्यादा आम हो सकते हैं।
क्या कोई बता सकता है कि इसका मतलब क्या है? मैं समझ नहीं पा रहा हूँ, उफ़ उफ़