- OpenIntro प्रोजेक्ट की statistics textbook Introduction to Modern Statistics, 2nd Edition वेब पर मुफ्त उपलब्ध है
- textbook का मुख्य पाठ वेब पर हमेशा मुफ्त देखा जा सकता है, और PDF Leanpub से मुफ्त या अपनी चुनी हुई योगदान राशि पर मिल सकती है
- ब्लैक-एंड-व्हाइट paperback 25 डॉलर में बिकती है, copyright वर्ष 2024 है और version date 31 मार्च 2026 है
- slides, practicals, interactive tutorials सहित supplementary materials भी openintro.org/book/ims से मुफ्त डाउनलोड किए जा सकते हैं
- यह textbook मौजूदा OpenIntro statistics textbooks की derivative work है और CC BY-SA 3.0 Unported United States License के तहत उपलब्ध है
OpenIntro की मुफ्त statistics textbook
- Introduction to Modern Statistics, Second Edition, Mine Çetinkaya-Rundel और Johanna Hardin की statistics textbook है
- इस textbook को IMS कहा जाता है और यह OpenIntro प्रोजेक्ट का हिस्सा है
- वेबसाइट Netlify पर host की गई है
उपलब्ध formats और कीमत
- textbook का मुख्य पाठ वेब पर हमेशा मुफ्त उपलब्ध है
- Download PDF के जरिए Leanpub से PDF मिल सकती है
- PDF मुफ्त या user द्वारा चुनी गई contribution amount पर उपलब्ध है
- ब्लैक-एंड-व्हाइट paperback 25 डॉलर में खरीदी जा सकती है
- copyright वर्ष 2024 है, और version date 31 मार्च 2026 है
supplementary materials और license
- textbook और supplementary materials openintro.org/book/ims से मुफ्त डाउनलोड किए जा सकते हैं
- supplementary materials में slides, practicals, interactive tutorials शामिल हैं
- यह textbook OpenIntro Statistics 4th Edition और Introduction to Statistics with Randomization and Simulation 1st Edition की derivative work है
- license Creative Commons Attribution-ShareAlike 3.0 Unported United States License है
- license की details creativecommons.org पर देखी जा सकती हैं
- source files GitHub पर github.com/openintrostat/ims में हैं
1 टिप्पणियां
Hacker News की रायें
मुझे लगता है कि कंप्यूटर accessibility की वजह से statistics की शिक्षा में काफ़ी बदलाव आ रहा है
उदाहरण के लिए, hypothesis testing को randomization[1] के ज़रिए introduce किया जाता है, और random permutation test[2] का इस्तेमाल होता है
पारंपरिक तरीके से statistics सीखते समय हमने बस “इस स्थिति में t-test, उस स्थिति में chi-square test” जैसी cookbook-style सूची सीखी थी, और यह नहीं समझा था कि ऐसे test क्यों इस्तेमाल करने चाहिए या वे आए कहाँ से
थोड़ा अलग संदर्भ में मिलता-जुलता approach देखने के लिए [3] भी है
[1]: https://openintro-ims2.netlify.app/11-foundations-randomizat...
[2]: https://en.wikipedia.org/wiki/Permutation_test
[3]: https://inferentialthinking.com/chapters/11/1/Assessing_a_Mo...
Gosset ने t-test बनाया और उसकी validity prove की, लेकिन students को अक्सर इसे black box की तरह apply करना सिखाया जाता है, बिना इस बात की बुनियादी समझ के कि यह सही क्यों है; educational तौर पर यह अच्छा नहीं है
इस मामले में मुझे Bayesian statistics कहीं बेहतर लगती है। logic से जुड़ा Curry-Howard isomorphism बहुत गहरा है, और इसे closed-form analytic solution वाली conjugate distributions के ज़रिए भी introduce किया जा सकता है
ज़्यादा complex चीज़ें computer का काम हैं, और STAN जैसे tools से frequentist methods की तुलना में कहीं ज़्यादा sophisticated complex distributions भी संभाली जा सकती हैं
permutation test संतोषजनक लगा क्योंकि उसने distribution theory में पहले से पता चीज़ों को व्यवस्थित कर दिया, लेकिन अगर distribution theory बिल्कुल न पता होती तो क्या वही असर होता, यह नहीं जानता
mathematical statistics पढ़ने पर आप cookbook-style में नहीं सीखते। शुरुआती स्तर पर probability theory और distribution theory, कई distributions सीखते हैं, और hypothesis testing, regression, analysis of variance वगैरह वहीं से आगे बढ़ते हैं
दूसरी ओर research scientists अक्सर किसी खास field के लिए छोटे courses, जैसे biologists के लिए statistics, के रूप में सीखते हैं, इसलिए वे statistics को recipes के bundle की तरह देखते लगते हैं
binomial distribution काफ़ी concrete है, इसलिए students के लिए p-value का concept पकड़ना आसान होता है, लेकिन बाद में normal distribution और t-distribution आदि की ओर बढ़ते हुए बात धीरे-धीरे abstract होती जाती है और “कब क्या इस्तेमाल करें” वाली cookbook approach में बदल जाती है
इस field में educational experiments, खासकर open textbooks के रूप में, मुझे बहुत सराहनीय और पसंद हैं, लेकिन introductory statistics को इस तरह के overall तरीके से पढ़ाना मुझे सच में पसंद नहीं है
उम्मीद है कि समय के साथ हम ad-hoc null hypothesis significance testing से हटकर linear models केंद्रित approach की ओर, और default के रूप में Bayesian approach इस्तेमाल करने की दिशा में बढ़ेंगे
मुझे लगता है कि introductory course में भी यह शुरुआत से संभव है, और नीचे वाला link reference के रूप में उपयोगी है: https://lindeloev.github.io/tests-as-linear/#:~:text=Most%20...
हालांकि “default के रूप में Bayesian” approach मुझे थोड़ा ज़्यादा uncertain दिशा में जाती हुई लगती है
software engineers में आम तौर पर यह क्षमता होती है, लेकिन statistics users की majority में नहीं होती
जिन social scientists को numbers या equations खुद पसंद नहीं हैं, उन्हें इन linear methods की similarities और “सब कुछ एक ही है” वाली व्याख्या देने की कोशिश करेंगे तो वे और ज़्यादा confuse हो सकते हैं
फिर भी अगर आप दोनों methods के effects को appropriate linear model से estimate करने वाला randomized experiment करें, तो ज़रूर बताइएगा। यह 10 में 10 वाला experiment होगा
[1]: https://lindeloev.github.io/tests-as-linear/#41_one_sample_t...
यहाँ authors में Mine Çetinkaya-Rundel को देखकर अच्छा लगा
बहुत से लोग उन्हें “R for Data Science”(https://r4ds.had.co.nz/) में उनके योगदान से जानते होंगे, लेकिन उन्होंने data science education पर भी कई बेहतरीन papers लिखे हैं
अब तक जितने instructors देखे हैं, उनमें वे साफ़ तौर पर top tier की हैं
statistics और probability पर मेरी पसंदीदा किताबों में से एक Andrew Gelman, Jennifer Hill, Aki Vehtari की Regression and Other Stories है
इसे यहाँ मुफ़्त में देखा जा सकता है: https://users.aalto.fi/~ave/ROS.pdf
यह जानना चाहूंगा कि क्या statistics को समझने के लिए ज़रूरी सोच और concepts सिखाने वाली कोई pre-statistics किताब है
probability के basic tools की मजबूत समझ हो तो statistics काफी आसानी से सीखी जा सकती है
उस समझ के बिना statistics recipe के bundle जैसी दिखने की संभावना ज्यादा है
इसके उलट, अगर probability से परिचित हैं तो असल समस्या को mathematical form में ढाल सकते हैं और थोड़ी search से जरूरी statistical tools खोज सकते हैं
basic calculus से ज्यादा बहुत कुछ चाहिए नहीं
बहुत से लोगों में बचपन में खराब teachers की वजह से “मैं maths में अच्छा नहीं हूं” जैसी मानसिक दीवार बन जाती है
बस शुरू कर दीजिए, पछतावा नहीं होगा
Ronald Fisher ने confidence interval calculate करने में bootstrap का इस्तेमाल शायद नहीं किया होगा, लेकिन बाकी syllabus का ज्यादातर हिस्सा 1900s की शुरुआत में लगभग उन्हीं ने बनाया हुआ लगता है :-)
statistics पढ़ने के लिए मैंने एक comprehensive cheatsheet बनाई है: https://github.com/mavam/stat-cookbook
randomization और bootstrapping शामिल होना अच्छा लगा
लेकिन hypothesis framework का अब भी NHST होना अफसोसजनक है। किसी भी मायने में इसे “modern” कहना मुश्किल है
Bayes पर जाना हो तो course को पूरी तरह फिर से लिखना पड़ेगा
confidence intervals को alternative के रूप में सुझाते हुए भी देखा है, लेकिन उस पर भी objections हैं
यह तर्क भी देखा है कि hypothesis testing का इस्तेमाल बिल्कुल नहीं करना चाहिए
जब NHST अब भी व्यापक रूप से इस्तेमाल होता है और कोई स्पष्ट alternative नहीं है, तब students को उससे परिचित न कराना उल्टा नुकसानदेह मानता हूं
self-study के लिए अच्छी statistics books कौन-सी हैं, यह जानना चाहूंगा
linked book first-year introductory text है और वह भूमिका अच्छी तरह निभाती है
आगे बढ़ना चाहते हैं तो options बहुत हैं
Casella और Berger की Statistical Inference की बहुत अच्छी reputation है, जो statistics को first principles से बनाती है। लिंक नहीं दूंगा, लेकिन सरल search से इसका पूरा PDF scan मिल सकता है। Amazon reviews: https://www.amazon.com/Statistical-Inference-Roger-Berger/dp...
Freedman, Pisani, Purves की Statistics के reviews भी बहुत अच्छे हैं और online आसानी से मिल जाती है। Amazon reviews: https://www.amazon.com/Statistics-Fourth-David-Freedman-eboo...
Berkeley data science core curriculum की ज्यादातर books भी online हैं। यह pure statistics ही नहीं है, लेकिन computation और randomization का इस्तेमाल करने वाले modern तरीके से पढ़ाती है और सीखने लायक tools भी cover करती है
Data 8: https://inferentialthinking.com/chapters/intro.html, Data 100: https://learningds.org/intro.html, Data 140: http://prob140.org/textbook/content/README.html, Data 102: https://data102.org/fa23/resources/#textbooks-from-previous-...
सिर्फ Berkeley curriculum ही नहीं है; online courses दर्जनों, शायद सैकड़ों हैं। बस scope काफी बड़ा है, और हाल में data science education को देखते समय मैंने सबसे ज्यादा Berkeley वाली सामग्री पढ़ी थी
यह science fields के PhD students को ध्यान में रखती है, इसलिए focus इस पर है कि “scientific hypotheses को test करने और causality का पता लगाने के लिए statistics का इस्तेमाल कैसे किया जा सकता है”
mathematically बहुत गहराई में नहीं जाती, लेकिन मानती है कि reader में कुछ mathematical intuition है और वह statistics के बिना भी data analyze करने का अभ्यस्त है
असल में यह केवल Bayesian models और उन्हें computer से fit करने के तरीकों पर केंद्रित है, इसलिए frequentist पक्ष लगभग नहीं cover करती
इसके साथ video series भी उपलब्ध है: https://www.statlearning.com/
Joseph K. Blitzstein और Jessica Hwang की Introduction to Probability भी देखने लायक है। free में उपलब्ध है: http://probabilitybook.net (drive पर redirect होता है)
पसंद आए तो similar Think Bayes भी देखने लायक है
एक और है https://nostarch.com/learnbayes
अगर statistics की basics हैं और काफी अलग, ज्यादा causal और Bayesian perspective से फिर से सीखना चाहते हैं, तो Statistical Rethinking भी recommend कर सकता हूं